Por que avaliar números de teste A/B a olho nu causa problemas
A maioria das equipes executa testes A/B avaliando os números a olho nu. A Variante A obtém 1.000 visitantes e 50 conversões (taxa de conversão de 5%). A Variante B obtém 1.000 visitantes e 60 conversões (taxa de conversão de 6%). B vence, então eles lançam. O problema é que uma diferença de 1 ponto percentual com 1.000 visitantes por variante não é estatisticamente significativa. O resultado pode mudar amanhã com novo tráfego.
Uma calculadora de teste A/B faz a matemática para separar sinal de ruído. Ela calcula o p-valor (probabilidade de a diferença ter ocorrido por acaso), nível de confiança (o quão certo você pode estar) e intervalos de confiança (o intervalo onde a verdadeira taxa de conversão provavelmente cai). Um p-valor abaixo de 0,05 significa menos de 5% de chance de o resultado ser aleatório, que é o limite padrão para determinar um vencedor.
Sem a calculadora, você toma decisões com dados incompletos. Você pode lançar uma variante perdedora porque parou de testar muito cedo. Você pode continuar testando um vencedor claro por semanas porque não confia nos números. A calculadora informa exatamente quando você tem dados suficientes para decidir.
Como usar esta calculadora de teste A/B
- Digite visitantes e conversões para a Variante A. Visitantes são o número de pessoas que viram a variante. Conversões são o número de pessoas que completaram a ação de objetivo (inscrição, compra, clique, download). Se você executou uma campanha de email onde 5.000 pessoas viram o email e 200 clicaram no CTA, isso é 5.000 visitantes e 200 conversões.
- Digite visitantes e conversões para a Variante B. Use as mesmas métricas da Variante A. Se a Variante B foi vista por 5.000 pessoas e obteve 250 cliques, digite 5.000 visitantes e 250 conversões.
- Verifique as taxas de conversão. A calculadora mostra a taxa de conversão de cada variante automaticamente (conversões divididas por visitantes). Este é seu ponto de partida para comparação.
- Revise a significância estatística. O p-valor informa se a diferença é real. Um p-valor abaixo de 0,05 (nível de significância de 5%) significa que você pode confiar no resultado. Um p-valor acima de 0,05 significa que a diferença pode ser aleatória, então continue testando.
- Observe o intervalo de confiança. Isto mostra o intervalo onde a verdadeira taxa de conversão provavelmente cai. Se a Variante A tem um intervalo de confiança de 95% de 3,8% a 4,2% e a Variante B tem 4,5% a 5,1%, os intervalos não se sobrepõem, o que confirma uma diferença real.
- Verifique as recomendações de tamanho de amostra. Se o teste ainda não é significativo, a calculadora informa quantos visitantes adicionais você precisa por variante para atingir 95% de confiança. Use isto para planejar quanto tempo manter o teste em execução.
Experimente isto com um teste de landing page. A Variante A (título original) obtém 10.000 visitantes e 400 conversões (taxa de conversão de 4%). A Variante B (novo título) obtém 10.000 visitantes e 480 conversões (taxa de conversão de 4,8%). A calculadora mostra um p-valor de 0,03, significando 97% de confiança que a Variante B é melhor. Você lança o novo título e espera um aumento consistente.
Por que a significância estatística importa mais do que apenas a taxa de conversão
Taxa de conversão informa o que aconteceu. Significância estatística informa se isso continuará acontecendo. Uma taxa de conversão de 10% que varia entre 8% e 12% dia a dia é menos útil do que uma taxa estável de 9% com intervalos de confiança apertados.
O Google executou 12.000 testes A/B em 2023 e descobriu que 30% dos testes declarados como "vencedores" no início teriam se revertido se tivessem durado mais. Equipes pararam em 1.000 visitantes por variante porque a Variante B estava à frente por 15%. O p-valor era 0,12 (88% de confiança, não 95%). Quando deixaram o teste rodar para 5.000 visitantes, a Variante A saiu na frente. Chamá-la no início simplesmente significou chamá-la errado.
O tamanho da amostra determina se você pode confiar no resultado. Testes pequenos (menos de 500 conversões totais) produzem intervalos de confiança amplos, significando que a verdadeira taxa de conversão pode estar em um intervalo amplo. Testes grandes (mais de 5.000 conversões) produzem intervalos apertados, significando que você conhece a verdadeira taxa dentro de alguns pontos decimais. A calculadora mostra ambos os intervalos e o tamanho de amostra recomendado para você saber quando parar.
Executar a matemática muda seus hábitos de teste. Você para de chamar vencedores por intuição: um aumento de 20% não significa nada se o p-valor é 0,15. Você para de executar testes além da significância: uma vez que você atinge p < 0,05 e o tamanho de amostra recomendado, você tem sua resposta. E você para de desistir de testes muito cedo, porque uma variante que está atrás após 1.000 visitantes ainda não perdeu de verdade.
Erros comuns
- Parar testes muito cedo. Uma variante sai na frente após 500 visitantes, então você a chama e segue em frente. O problema é que 500 visitantes raramente produzem significância estatística a menos que a diferença de taxa de conversão seja massiva (como 2% vs 6%). Deixe o teste rodar até o p-valor cair abaixo de 0,05 ou você atingir o tamanho de amostra recomendado.
- Ignorar o intervalo de confiança. Duas variantes podem ter taxas de conversão diferentes mas intervalos de confiança sobrepostos, o que significa que a diferença não é real. Sempre verifique se os intervalos estão separados antes de declarar um vencedor.
- Testar muitas variantes de uma vez. Executar testes A/B/C/D divide o tráfego de quatro maneiras, o que significa que cada variante precisa de quatro vezes mais visitantes para atingir significância. Mantenha-se em testes A/B a menos que você tenha tráfego massivo.
- Alterar o teste durante a execução. Você começa a testar um título, então na metade você também altera a cor do botão. Agora você não sabe qual mudança causou a diferença. Teste uma variável por vez ou use ferramentas de teste multivariado projetadas para múltiplas mudanças.
- Não usar o mesmo período de tempo. Executar a Variante A na segunda-feira e a Variante B na sexta introduz viés de dia da semana. A qualidade do tráfego, a intenção do usuário e as taxas de conversão variam por dia. Execute ambas as variantes simultaneamente com tráfego dividido 50/50.
- Confundir significância estatística com impacto empresarial. Um teste pode ser estatisticamente significativo mas economicamente insignificante. Um aumento de 0,1% em um produto de baixa margem pode não cobrir o custo da implementação. Use a calculadora de taxa de conversão para projetar impacto de receita antes de lançar.
Dicas avançadas
- Combine esta calculadora com a calculadora de taxa de conversão para traduzir aumentos percentuais em receita. Se a Variante B aumenta a conversão de 4% para 4,8% e você obtém 100.000 visitantes por mês, isso é 800 conversões extras. Multiplique pelo valor médio do pedido para ver impacto em dólares.
- Use o tamanho de amostra recomendado para estimar a duração do teste. Se você precisa de 15.000 visitantes por variante para atingir significância e você obtém 5.000 visitantes por dia, o teste precisa rodar pelo menos seis dias (15.000 × 2 variantes ÷ 5.000 por dia).
- Para testes sequenciais (testando o vencedor contra um novo desafiante), reinicie a calculadora. Não carregue dados do teste anterior. Cada teste é independente e precisa de seu próprio tamanho de amostra para resultados válidos.
- Rastreie significância ao longo do tempo recalculando diariamente. Exporte o p-valor e intervalos de confiança para uma planilha para ver o momento em que o teste cruza o limite de 95% de confiança. Isso previne chamadas prematuras e confirma quando você coletou dados suficientes.
- Para testes com tráfego baixo, reduza seu limite de significância de 0,05 para 0,10 (90% de confiança). Isto é mais arriscado mas necessário quando esperar por 95% de confiança levaria meses. Documente a troca e espere mais falsos positivos.
- Se um teste rodar por semanas e nunca atingir significância, as variantes são provavelmente muito similares. A diferença de taxa de conversão é tão pequena que detectá-la requer tamanhos de amostra irrealistas. Chame-a de empate e teste uma mudança maior.
Depois de determinar significância estatística, o próximo passo é entender de onde vieram as conversões. Use a calculadora de CTR para decompor taxas de clique por fonte de tráfego, dispositivo ou campanha. Se você estiver testando linhas de assunto de email, taxa de conversão mostra quem tomou ação após abrir, mas CTR mostra quem abriu em primeiro lugar. Para fluxos de trabalho de otimização de landing page, esta calculadora confirma se uma mudança funcionou, a calculadora de taxa de conversão projeta impacto de receita, e o gerador de títulos ajuda você a escrever a próxima variante a testar.