O que significância realmente significa

Um teste A/B com 95% de confiança significa: se você rodasse esse mesmo teste 100 vezes, o resultado observado (ou um ainda mais extremo) apareceria por puro acaso em até 5 dessas vezes. Não é garantia absoluta — é uma medida de confiança.

Na prática, 95% é o padrão da indústria porque equilibra dois erros: declarar vencedor um resultado que é só ruído (falso positivo), e descartar como "sem diferença" um resultado que na verdade é real, mas o teste não teve poder estatístico suficiente para detectar (falso negativo).

Dica Prática de Consultoria

Precisa auditar esse cenário na sua empresa com dados reais? Converse com Wagner Hörlle para mapear pontos de melhoria ou simule o ganho na nossa Calculadora de Lucro Oculto.

Matriz de Amostra Mínima e Duração por Volume Mensal (Poder 80%, Confiança 95%) Metodologia Wagner Hörlle
Sessões Mensais no FunilMDE Alvo (Uplift Mínimo)Conversões Mínimas / VariaçãoDuração Recomendada do TesteRisco de Interrupção Precoce
30.000 / mês+15% a +20%~350 a 450 conversões3 a 4 semanas completasAlto se parar antes de 2 semanas
100.000 / mês+8% a +12%~750 a 900 conversões2 a 3 semanas completasMédio (aguardar ciclos de 7 dias)
300.000 / mês+5% a +8%~1.500 conversões14 dias (2 ciclos semanais)Baixo se atingir amostra pré-definida
1.000.000+ / mês+2% a +4%~3.200+ conversões7 a 14 diasMínimo com monitoramento de SRM

Os 3 erros que invalidam testes

  1. Parar o teste no primeiro momento em que fica "significativo". Checar o resultado todo dia e parar assim que cruza 95% infla artificialmente a taxa de falso positivo — é estatisticamente equivalente a jogar moeda várias vezes até dar cara. O tamanho de amostra e a duração devem ser definidos antes do teste começar.
  2. Tráfego insuficiente para o efeito que se espera detectar. Detectar uma diferença de 2% exige muito mais tráfego que detectar uma diferença de 20%. Calculadoras de tamanho de amostra (gratuitas, existem várias online) resolvem isso antes de começar — não depois.
  3. Rodar dezenas de testes simultâneos sem correção. Quanto mais testes rodando ao mesmo tempo, maior a chance de pelo menos um dar "significativo" por puro acaso. Isso não significa não testar — significa ser cético com resultados isolados em programas de teste com alto volume.

Um exemplo aplicado

Página de checkout com 10.000 visitantes/mês e conversão de 3%. Testar uma nova versão do botão de CTA que hipoteticamente sobe a conversão para 3,5% (uma melhora relativa de 17%) exige, dependendo da calculadora e do nível de confiança escolhido, algo na faixa de 8 a 10 mil visitantes por variante — ou seja, praticamente um mês inteiro de tráfego só para esse teste.

É por isso que operações com menos de ~30 mil sessões/mês (o parâmetro que uso como referência em o que é CRO) precisam ser realistas sobre quantos testes conseguem rodar por ano com significância real — e priorizar apenas as hipóteses de maior impacto potencial.

Significativo não é o mesmo que relevante

Um teste pode ser estatisticamente significativo e comercialmente irrelevante — uma melhora de 0,1% em conversão pode ser "real" e ainda assim não justificar o esforço de implementação. Sempre pergunte: mesmo que esse resultado seja verdadeiro, ele move a agulha da receita o suficiente para valer a pena?