Teste A/B: como calcular significância estatística na prática
"A versão B converteu 12% melhor" é uma frase perigosa quando ninguém checou se essa diferença é real ou apenas sorte de amostra pequena.
Significância estatística mede a probabilidade de um resultado ser real (e não ruído aleatório). O padrão de mercado é 95% de confiança — abaixo disso, o resultado não deve ser considerado conclusivo. Os três erros mais comuns em teste A/B são: parar o teste cedo demais, testar com tráfego insuficiente e rodar testes demais ao mesmo tempo sem corrigir para comparações múltiplas.
O que significância realmente significa
Um teste A/B com 95% de confiança significa: se você rodasse esse mesmo teste 100 vezes, o resultado observado (ou um ainda mais extremo) apareceria por puro acaso em até 5 dessas vezes. Não é garantia absoluta — é uma medida de confiança.
Na prática, 95% é o padrão da indústria porque equilibra dois erros: declarar vencedor um resultado que é só ruído (falso positivo), e descartar como "sem diferença" um resultado que na verdade é real, mas o teste não teve poder estatístico suficiente para detectar (falso negativo).
Os 3 erros que invalidam testes
- Parar o teste no primeiro momento em que fica "significativo". Checar o resultado todo dia e parar assim que cruza 95% infla artificialmente a taxa de falso positivo — é estatisticamente equivalente a jogar moeda várias vezes até dar cara. O tamanho de amostra e a duração devem ser definidos antes do teste começar.
- Tráfego insuficiente para o efeito que se espera detectar. Detectar uma diferença de 2% exige muito mais tráfego que detectar uma diferença de 20%. Calculadoras de tamanho de amostra (gratuitas, existem várias online) resolvem isso antes de começar — não depois.
- Rodar dezenas de testes simultâneos sem correção. Quanto mais testes rodando ao mesmo tempo, maior a chance de pelo menos um dar "significativo" por puro acaso. Isso não significa não testar — significa ser cético com resultados isolados em programas de teste com alto volume.
Um exemplo aplicado
Página de checkout com 10.000 visitantes/mês e conversão de 3%. Testar uma nova versão do botão de CTA que hipoteticamente sobe a conversão para 3,5% (uma melhora relativa de 17%) exige, dependendo da calculadora e do nível de confiança escolhido, algo na faixa de 8 a 10 mil visitantes por variante — ou seja, praticamente um mês inteiro de tráfego só para esse teste.
É por isso que operações com menos de ~30 mil sessões/mês (o parâmetro que uso como referência em o que é CRO) precisam ser realistas sobre quantos testes conseguem rodar por ano com significância real — e priorizar apenas as hipóteses de maior impacto potencial.
Significativo não é o mesmo que relevante
Um teste pode ser estatisticamente significativo e comercialmente irrelevante — uma melhora de 0,1% em conversão pode ser "real" e ainda assim não justificar o esforço de implementação. Sempre pergunte: mesmo que esse resultado seja verdadeiro, ele move a agulha da receita o suficiente para valer a pena?
Perguntas frequentes
95% é sempre o nível de confiança certo?
Posso confiar em um teste A/B com poucos dias de duração?
Existe alternativa ao teste A/B para times com pouco tráfego?
Diagnóstico gratuito de 45 min
Análise do seu funil, canais e operação de mídia — com direções concretas do que fazer primeiro. Sem compromisso.
Agendar diagnóstico gratuito →