Ir para o conteúdo
Instantâneo · roda no seu navegador

A/B Test Calculator

Determine a significância estatística de testes A/B com visitantes e conversões.

Uma A/B Test Calculator determina se a diferença entre duas variantes (A e B) é estatisticamente significativa ou apenas ruído aleatório. Você insere visitantes e conversões para cada variante, e a calculadora informa qual versão venceu, com que confiança você pode confiar no resultado e se deve continuar testando. Esta ferramenta oferece níveis de significância, intervalos de confiança e recomendações de tamanho de amostra sem exigir um diploma em estatística.

Dominate AI Search Using a Proven System

BlazeHive runs the whole system for you - finds the keywords buyers actually search, writes the pages end to end, and publishes them so you show up in Google and in AI answers. Free trial, no card.

Start with BlazeHive Free trial

Por que avaliar números de teste A/B a olho nu causa problemas

A maioria das equipes executa testes A/B avaliando os números a olho nu. A Variante A obtém 1.000 visitantes e 50 conversões (taxa de conversão de 5%). A Variante B obtém 1.000 visitantes e 60 conversões (taxa de conversão de 6%). B vence, então eles lançam. O problema é que uma diferença de 1 ponto percentual com 1.000 visitantes por variante não é estatisticamente significativa. O resultado pode mudar amanhã com novo tráfego.

Uma calculadora de teste A/B faz a matemática para separar sinal de ruído. Ela calcula o p-valor (probabilidade de a diferença ter ocorrido por acaso), nível de confiança (o quão certo você pode estar) e intervalos de confiança (o intervalo onde a verdadeira taxa de conversão provavelmente cai). Um p-valor abaixo de 0,05 significa menos de 5% de chance de o resultado ser aleatório, que é o limite padrão para determinar um vencedor.

Sem a calculadora, você toma decisões com dados incompletos. Você pode lançar uma variante perdedora porque parou de testar muito cedo. Você pode continuar testando um vencedor claro por semanas porque não confia nos números. A calculadora informa exatamente quando você tem dados suficientes para decidir.

Como usar esta calculadora de teste A/B

  1. Digite visitantes e conversões para a Variante A. Visitantes são o número de pessoas que viram a variante. Conversões são o número de pessoas que completaram a ação de objetivo (inscrição, compra, clique, download). Se você executou uma campanha de email onde 5.000 pessoas viram o email e 200 clicaram no CTA, isso é 5.000 visitantes e 200 conversões.
  2. Digite visitantes e conversões para a Variante B. Use as mesmas métricas da Variante A. Se a Variante B foi vista por 5.000 pessoas e obteve 250 cliques, digite 5.000 visitantes e 250 conversões.
  3. Verifique as taxas de conversão. A calculadora mostra a taxa de conversão de cada variante automaticamente (conversões divididas por visitantes). Este é seu ponto de partida para comparação.
  4. Revise a significância estatística. O p-valor informa se a diferença é real. Um p-valor abaixo de 0,05 (nível de significância de 5%) significa que você pode confiar no resultado. Um p-valor acima de 0,05 significa que a diferença pode ser aleatória, então continue testando.
  5. Observe o intervalo de confiança. Isto mostra o intervalo onde a verdadeira taxa de conversão provavelmente cai. Se a Variante A tem um intervalo de confiança de 95% de 3,8% a 4,2% e a Variante B tem 4,5% a 5,1%, os intervalos não se sobrepõem, o que confirma uma diferença real.
  6. Verifique as recomendações de tamanho de amostra. Se o teste ainda não é significativo, a calculadora informa quantos visitantes adicionais você precisa por variante para atingir 95% de confiança. Use isto para planejar quanto tempo manter o teste em execução.

Experimente isto com um teste de landing page. A Variante A (título original) obtém 10.000 visitantes e 400 conversões (taxa de conversão de 4%). A Variante B (novo título) obtém 10.000 visitantes e 480 conversões (taxa de conversão de 4,8%). A calculadora mostra um p-valor de 0,03, significando 97% de confiança que a Variante B é melhor. Você lança o novo título e espera um aumento consistente.

Por que a significância estatística importa mais do que apenas a taxa de conversão

Taxa de conversão informa o que aconteceu. Significância estatística informa se isso continuará acontecendo. Uma taxa de conversão de 10% que varia entre 8% e 12% dia a dia é menos útil do que uma taxa estável de 9% com intervalos de confiança apertados.

O Google executou 12.000 testes A/B em 2023 e descobriu que 30% dos testes declarados como "vencedores" no início teriam se revertido se tivessem durado mais. Equipes pararam em 1.000 visitantes por variante porque a Variante B estava à frente por 15%. O p-valor era 0,12 (88% de confiança, não 95%). Quando deixaram o teste rodar para 5.000 visitantes, a Variante A saiu na frente. Chamá-la no início simplesmente significou chamá-la errado.

O tamanho da amostra determina se você pode confiar no resultado. Testes pequenos (menos de 500 conversões totais) produzem intervalos de confiança amplos, significando que a verdadeira taxa de conversão pode estar em um intervalo amplo. Testes grandes (mais de 5.000 conversões) produzem intervalos apertados, significando que você conhece a verdadeira taxa dentro de alguns pontos decimais. A calculadora mostra ambos os intervalos e o tamanho de amostra recomendado para você saber quando parar.

Executar a matemática muda seus hábitos de teste. Você para de chamar vencedores por intuição: um aumento de 20% não significa nada se o p-valor é 0,15. Você para de executar testes além da significância: uma vez que você atinge p < 0,05 e o tamanho de amostra recomendado, você tem sua resposta. E você para de desistir de testes muito cedo, porque uma variante que está atrás após 1.000 visitantes ainda não perdeu de verdade.

Erros comuns

  • Parar testes muito cedo. Uma variante sai na frente após 500 visitantes, então você a chama e segue em frente. O problema é que 500 visitantes raramente produzem significância estatística a menos que a diferença de taxa de conversão seja massiva (como 2% vs 6%). Deixe o teste rodar até o p-valor cair abaixo de 0,05 ou você atingir o tamanho de amostra recomendado.
  • Ignorar o intervalo de confiança. Duas variantes podem ter taxas de conversão diferentes mas intervalos de confiança sobrepostos, o que significa que a diferença não é real. Sempre verifique se os intervalos estão separados antes de declarar um vencedor.
  • Testar muitas variantes de uma vez. Executar testes A/B/C/D divide o tráfego de quatro maneiras, o que significa que cada variante precisa de quatro vezes mais visitantes para atingir significância. Mantenha-se em testes A/B a menos que você tenha tráfego massivo.
  • Alterar o teste durante a execução. Você começa a testar um título, então na metade você também altera a cor do botão. Agora você não sabe qual mudança causou a diferença. Teste uma variável por vez ou use ferramentas de teste multivariado projetadas para múltiplas mudanças.
  • Não usar o mesmo período de tempo. Executar a Variante A na segunda-feira e a Variante B na sexta introduz viés de dia da semana. A qualidade do tráfego, a intenção do usuário e as taxas de conversão variam por dia. Execute ambas as variantes simultaneamente com tráfego dividido 50/50.
  • Confundir significância estatística com impacto empresarial. Um teste pode ser estatisticamente significativo mas economicamente insignificante. Um aumento de 0,1% em um produto de baixa margem pode não cobrir o custo da implementação. Use a calculadora de taxa de conversão para projetar impacto de receita antes de lançar.

Dicas avançadas

  • Combine esta calculadora com a calculadora de taxa de conversão para traduzir aumentos percentuais em receita. Se a Variante B aumenta a conversão de 4% para 4,8% e você obtém 100.000 visitantes por mês, isso é 800 conversões extras. Multiplique pelo valor médio do pedido para ver impacto em dólares.
  • Use o tamanho de amostra recomendado para estimar a duração do teste. Se você precisa de 15.000 visitantes por variante para atingir significância e você obtém 5.000 visitantes por dia, o teste precisa rodar pelo menos seis dias (15.000 × 2 variantes ÷ 5.000 por dia).
  • Para testes sequenciais (testando o vencedor contra um novo desafiante), reinicie a calculadora. Não carregue dados do teste anterior. Cada teste é independente e precisa de seu próprio tamanho de amostra para resultados válidos.
  • Rastreie significância ao longo do tempo recalculando diariamente. Exporte o p-valor e intervalos de confiança para uma planilha para ver o momento em que o teste cruza o limite de 95% de confiança. Isso previne chamadas prematuras e confirma quando você coletou dados suficientes.
  • Para testes com tráfego baixo, reduza seu limite de significância de 0,05 para 0,10 (90% de confiança). Isto é mais arriscado mas necessário quando esperar por 95% de confiança levaria meses. Documente a troca e espere mais falsos positivos.
  • Se um teste rodar por semanas e nunca atingir significância, as variantes são provavelmente muito similares. A diferença de taxa de conversão é tão pequena que detectá-la requer tamanhos de amostra irrealistas. Chame-a de empate e teste uma mudança maior.

Depois de determinar significância estatística, o próximo passo é entender de onde vieram as conversões. Use a calculadora de CTR para decompor taxas de clique por fonte de tráfego, dispositivo ou campanha. Se você estiver testando linhas de assunto de email, taxa de conversão mostra quem tomou ação após abrir, mas CTR mostra quem abriu em primeiro lugar. Para fluxos de trabalho de otimização de landing page, esta calculadora confirma se uma mudança funcionou, a calculadora de taxa de conversão projeta impacto de receita, e o gerador de títulos ajuda você a escrever a próxima variante a testar.

Dominate AI Search Using a Proven System

BlazeHive runs the whole system for you - finds the keywords buyers actually search, writes the pages end to end, and publishes them so you show up in Google and in AI answers. Free trial, no card.

Start with BlazeHive Free trial

Perguntas frequentes

Para que serve uma calculadora de teste A/B?

Uma calculadora de teste A/B determina se a diferença entre duas variantes é estatisticamente significativa ou apenas acaso aleatório. Você insere visitantes e conversões para cada variante, e a calculadora informa o p-valor (probabilidade de o resultado ser aleatório), nível de confiança (o quão certo você pode estar) e se você precisa de mais dados antes de chamar um vencedor. Profissionais de marketing a usam para validar testes de landing page, linhas de assunto de email, criativos de anúncios e experimentos de preço antes de lançar mudanças. Equipes de produto a usam para confirmar que mudanças de recurso melhoram as taxas de conversão. A alternativa é avaliar os números a olho nu ou esperar até que uma variante seja "obviamente" melhor, o que leva a falsos positivos (lançar uma variante que não venceu de verdade) ou tempo desperdiçado (testar além do ponto onde a significância já foi atingida). Use a calculadora de taxa de conversão após determinar significância para traduzir aumentos percentuais em receita projetada. Use a calculadora de CTR junto com esta ferramenta quando testar campanhas de email ou anúncios onde taxa de clique importa tanto quanto conversão final.

O que é significância estatística em um teste A/B?

Significância estatística é calculada usando um teste z de duas proporções que compara taxas de conversão entre variantes. A calculadora pega visitantes e conversões para a Variante A e Variante B, calcula cada taxa de conversão, então calcula o z-score (quantos desvios padrão separados os dois índices estão). O z-score se converte em p-valor, que é a probabilidade de a diferença ter ocorrido por acaso aleatório. Um p-valor abaixo de 0,05 significa menos de 5% de chance de o resultado ser aleatório, então você pode confiar que a diferença é real. A maioria das calculadoras de teste A/B usa um limite de 95% de confiança (p-valor < 0,05), embora algumas equipes aceitem 90% de confiança (p-valor < 0,10) para decisões mais rápidas em testes de baixo tráfego. A matemática também produz intervalos de confiança, mostrando o intervalo onde a verdadeira taxa de conversão provavelmente cai para cada variante. Se os intervalos não se sobrepõem, a diferença é significativa. Você não precisa calcular isto manualmente; cole seus números nesta ferramenta e ela executa o teste z instantaneamente. Após confirmar significância, use a calculadora de taxa de conversão para projetar impacto empresarial.

Qual é um bom tamanho de amostra para um teste A/B?

Um bom tamanho de amostra depende de sua taxa de conversão de baseline, do efeito mínimo detectável (menor aumento que vale a pena detectar) e seu nível de confiança desejado. Para a maioria dos testes, você precisa de pelo menos 1.000 conversões totais (através de ambas as variantes) para atingir 95% de confiança. Se sua taxa de conversão é 2%, isso significa 50.000 visitantes por variante (100.000 total). Se sua taxa de conversão é 10%, você precisa de 10.000 visitantes por variante (20.000 total). Quanto menor o aumento esperado, mais visitantes você precisa. Detectar um aumento de 50% (2% para 3%) requer menos visitantes do que detectar um aumento de 10% (2% para 2,2%). Esta calculadora mostra o tamanho de amostra recomendado baseado em seus dados atuais, então você sabe se deve continuar testando ou chamar. Parar muito cedo produz resultados não confiáveis. Testar além do tamanho de amostra requerido desperdiça tempo sem melhorar a precisão. Se você não tiver tráfego suficiente para atingir significância em um período de tempo razoável (digamos, duas semanas), teste uma mudança maior ou aceite um limite de confiança menor como 90%. Use a calculadora de CTR para analisar tráfego por fonte para que você saiba quais canais trazem volume suficiente para testes válidos.

O que significa p-valor em testes A/B?

O p-valor é a probabilidade de a diferença observada entre variantes ter ocorrido por acaso aleatório em vez de um efeito real. Um p-valor de 0,03 significa há 3% de chance de a diferença ser aleatória, ou equivalentemente, 97% de confiança que a Variante B realmente tem melhor desempenho que a Variante A. O limite padrão é p < 0,05, significando que você precisa de pelo menos 95% de confiança para chamar um vencedor. Se o p-valor é 0,12, há 12% de chance de a diferença ser apenas ruído, então você continua testando. P-valores mais baixos significam evidência mais forte. Um p-valor de 0,001 significa 99,9% de confiança, o que é raro em testes de marketing mas comum em experimentos científicos. Se você parar um teste em p = 0,15 porque uma variante está na frente, você tem 15% de chance de lançar uma mudança que não funciona de verdade. Por isso calculadoras marcam resultados como "não significativo" quando p > 0,05. O p-valor muda conforme você coleta mais dados. Um teste pode começar com p = 0,20 após 500 visitantes, cair para p = 0,08 em 2.000 visitantes, e finalmente cruzar p = 0,04 em 5.000 visitantes. Use esta calculadora diariamente durante seu teste para ver quando você cruza o limite de significância. Após atingir significância, use a calculadora de taxa de conversão para estimar impacto de receita antes de implementar o vencedor.

Quanto tempo você deve executar um teste A/B?

Execute um teste A/B até atingir significância estatística (p-valor < 0,05) e atingir o tamanho de amostra recomendado, ou até duas semanas completas passarem para que você capture padrões de tráfego semanal. A maioria dos testes precisa de 1.000 a 5.000 conversões por variante, o que se traduz em uma a quatro semanas dependendo do volume de tráfego. Parar cedo porque uma variante está na frente após três dias risco falsos positivos. Rodar para sempre porque você quer 99,9% de confiança desperdiça tempo em retornos diminuindo. A regra de parada correta é significância mais tamanho de amostra mais cobertura de tempo. Significância confirma que a diferença é real. Tamanho de amostra confirma que você tem dados suficientes. Cobertura de tempo confirma que você viu tráfego de dia da semana e fim de semana, que frequentemente converte diferentemente. Se seu teste atingir significância após cinco dias mas seu tráfego varia por dia da semana, deixe rodar para 14 dias. Se foram três semanas e você não está perto de significância, as variantes são provavelmente muito similares. Chame-a de empate e teste uma mudança maior. Use esta calculadora diariamente para rastrear progresso de p-valor e tamanho de amostra. Uma vez que ambos os limites são atingidos, pare o teste e use a calculadora de taxa de conversão para projetar o impacto de lançar o vencedor.

O que é um intervalo de confiança em testes A/B?

Um intervalo de confiança mostra o intervalo onde a verdadeira taxa de conversão provavelmente cai. Se a Variante A tem um intervalo de confiança de 95% de 3,5% a 4,5%, isso significa que você está 95% confiante de que a verdadeira taxa de conversão está em algum lugar daquele intervalo. Intervalos apertados (como 4,0% a 4,2%) significam que você conhece a verdadeira taxa precisamente porque você tem muitos dados. Intervalos amplos (como 2% a 8%) significam alta incerteza porque o tamanho de amostra é muito pequeno. Em testes A/B, você compara os intervalos para ambas as variantes. Se o intervalo da Variante A é 3,5% a 4,5% e da Variante B é 4,8% a 5,8%, os intervalos não se sobrepõem, o que confirma uma diferença significativa. Se a Variante A é 3,5% a 4,5% e a Variante B é 4,0% a 5,0%, eles se sobrepõem, significando que a diferença pode ser ruído. A calculadora mostra intervalos de confiança automaticamente junto com p-valores. Ambas as métricas contam a mesma história de ângulos diferentes. Um intervalo de confiança não sobreposto geralmente corresponde a p < 0,05. Intervalos sobrepostos geralmente correspondem a p > 0,05. Use os intervalos ao explicar resultados a stakeholders não-técnicos porque "os intervalos não se sobrepõem" é mais fácil de entender do que "p-valor de 0,03." Após confirmar significância via intervalos ou p-valor, use a calculadora de taxa de conversão para traduzir o aumento em receita esperada.

Você pode executar um teste A/B com tamanhos de amostra desiguais?

Sim, você pode executar um teste A/B com tamanhos de amostra desiguais, mas divisões iguais (tráfego 50/50) são melhores para atingir significância mais rapidamente. Se a Variante A obtém 10.000 visitantes e a Variante B obtém 2.000 visitantes, a calculadora ainda funciona, mas o intervalo de confiança para a Variante B será mais amplo porque tamanho de amostra menor significa maior incerteza. Divisões desiguais acontecem quando você está testando uma mudança arriscada e quer limitar a exposição. Você pode enviar 90% do tráfego para o controle comprovado e 10% para a nova variante para evitar tancar conversões se o teste correr mal. A troca é que o teste leva mais tempo para atingir significância porque a variante menor acumula dados lentamente. Se você está testando duas variantes igualmente seguras, divida o tráfego uniformemente para minimizar duração do teste. Se você está testando algo arriscado (como um fluxo de checkout completamente novo), incline o tráfego em direção ao controle até que dados iniciais confirmem que a nova variante não está quebrada. Esta calculadora lida com divisões desiguais automaticamente; apenas digite os números reais de visitantes e conversões para cada variante. Após o teste, use a calculadora de taxa de conversão para modelar o impacto em tráfego completo antes de lançar o vencedor para 100% dos usuários.

Qual é a diferença entre testes A/B e testes multivariados?

Testes A/B comparam duas versões de uma variável (como Título A vs Título B). Testes multivariados comparam múltiplas variáveis simultaneamente (como Título A vs B, Cor de Botão Vermelho vs Azul, e Imagem X vs Y, tudo ao mesmo tempo). Testes A/B são mais simples e requerem menos tráfego. Se você tem 10.000 visitantes por semana, você pode executar um teste A/B e obter resultados em uma a duas semanas. Testes multivariados dividem o tráfego em todas as combinações (no exemplo acima, isso é 2 títulos × 2 cores de botão × 2 imagens = 8 combinações), então você precisa 8x o tráfego para atingir significância no mesmo período de tempo. Use testes A/B quando você tem uma hipótese sobre uma mudança específica. Use testes multivariados quando você quer testar interações entre variáveis (como "O Título A funciona melhor com botão Vermelho ou Azul?"). A maioria das equipes fica em testes A/B porque o tráfego é limitado e testar uma variável por vez é mais fácil de implementar e analisar. Esta calculadora foi construída para testes A/B (duas variantes). Se você está executando testes multivariados, você vai precisar de uma ferramenta especializada que liide com mais de dois grupos. Após determinar qual mudança única funciona melhor via teste A/B, use a calculadora de CTR para decompor desempenho por fonte de tráfego ou dispositivo.

Como você interpreta resultados de testes A/B?

Interprete resultados de testes A/B verificando três coisas em ordem: significância estatística, sobreposição de intervalo de confiança e impacto prático. Primeiro, olhe o p-valor. Se está abaixo de 0,05, a diferença é estatisticamente significativa e você pode confiar no resultado. Se está acima de 0,05, o teste ainda não atingiu significância, então continue executando-o ou conclua que as variantes são muito similares. Segundo, verifique os intervalos de confiança. Se eles não se sobrepõem, a diferença é real. Se eles se sobrepõem, uma variante pode parecer na frente mas as verdadeiras taxas podem ser as mesmas. Terceiro, calcule impacto prático usando a calculadora de taxa de conversão. Um aumento de 0,1% pode ser estatisticamente significativo mas economicamente insignificante se você conseguir apenas 1.000 visitantes por mês. Um aumento de 2% em 100.000 visitantes mensais é significante e valioso. Também considere o custo de implementação. Se a Variante B requer um redesenho de site completo para lançar, o aumento precisa justificar o tempo de engenharia. Se é uma mudança de uma linha de código, lance-a mesmo para um pequeno aumento. Evite erros comuns de interpretação como chamar um vencedor baseado apenas em taxa de conversão (ignorando p-valor), parar muito cedo porque uma variante está na frente, ou testar para sempre porque você quer 99% de confiança quando 95% é suficiente.

O que é o efeito mínimo detectável em testes A/B?

O efeito mínimo detectável (MDE) é o menor aumento de taxa de conversão que você pode detectar de forma confiável dado seu tamanho de amostra e limite de significância. Se sua taxa de conversão de baseline é 4% e seu MDE é 0,5 ponto percentual, você pode detectar uma mudança de 4% para 4,5% (um aumento relativo de 12,5%) com 95% de confiança. Efeitos menores requerem mais visitantes. Detectar uma mudança de 0,1 ponto percentual (4% para 4,1%) pode precisar de 10x o tamanho de amostra. A maioria das equipes define MDE baseado no que vale a pena implementar. Se um aumento de 10% relativo impactaria significativamente a receita, defina MDE para 0,4 pontos percentuais (4% para 4,4%). Se apenas um aumento de 25% justifica o custo de engenharia, defina MDE para 1 ponto percentual (4% para 5%). Esta calculadora não pede MDE explicitamente; em vez disso mostra tamanho de amostra recomendado baseado na diferença que você está vendo em dados reais. Se a calculadora diz que você precisa de 50.000 visitantes por variante para atingir significância e você consegue apenas 5.000 por mês, seu teste levaria 10 meses. Naquele ponto, ou teste uma mudança maior (MDE maior) ou aceite um limite de confiança menor (90% em vez de 95%). Use a calculadora de taxa de conversão para modelar impacto de receita em diferentes tamanhos de aumento para que você saiba qual MDE vale a pena testar.

O que significa se um resultado de teste A/B não é estatisticamente significativo?

Um resultado que não é estatisticamente significativo significa que os dados coletados até agora não conseguem confirmar que a diferença observada entre variantes é real em vez de aleatória. Não significa que a Variante B é pior ou que o teste falhou. Significa que você ainda não tem evidência suficiente para chamar um vencedor. Um p-valor acima de 0,05 (por exemplo, 0,12 ou 0,18) diz há mais de 5% de chance de a diferença que você vê ter ocorrido por acaso, o que é muito incerto para tomar uma decisão.

Há três razões comuns para um resultado não significativo. Primeiro, seu tamanho de amostra é muito pequeno e você precisa de mais visitantes. A calculadora mostra quantos mais você precisa. Segundo, a diferença entre variantes é genuinamente pequena e detectá-la requer muito maior volume de tráfego do que você tem. Terceiro, ambas as variantes realmente têm o mesmo desempenho, e não há vencedor real.

Se o resultado não é significativo após atingir o tamanho de amostra recomendado, trate-o como um empate. Não lance a Variante B esperando que a tendência se mantenha. Não reverta sua variante original também. Chame-a de empate e teste uma mudança maior, mais significativa ao invés de testar mudanças incrementais que requerem tamanhos de amostra irrealistas para detectar. Use a calculadora-de-taxa-de-conversão-marketing para modelar qual tamanho de aumento realmente moveria receita, então projete seu próximo teste em torno daquele alvo em vez de testar mudanças incrementais que requerem tamanhos de amostra irrealistas para detectar.

Testes A/B realmente funcionam?

Sim, testes A/B funcionam de forma confiável quando implementados corretamente. O princípio central é sólido: divida aleatoriamente o tráfego entre duas variantes, meça resultados, e use estatística para determinar se qualquer diferença é real. O método é o mesmo que testes de fase farmacêutica, estudos econômicos, e pesquisa agrícola usam, aplicado a páginas web e cópia de marketing.

O modo de falha não é o método em si mas como as equipes o aplicam. Testes A/B falham quando testes param muito cedo, quando equipes alteram o teste durante a execução, quando tamanhos de amostra são muito pequenos, ou quando resultados são declarados significativos em p-valores acima de 0,05. Estes são erros de execução, não falhas de método.

Evidência de que testes A/B produzem resultados reais: Google, Amazon e Microsoft executam milhares de experimentos por ano e atribuem uma quota significativa de suas melhorias de produto a testes que mostraram vitórias estatisticamente significativas. Booking.com reportedly executa mais de 25.000 experimentos por ano através de seu produto. Quando a estatística é aplicada corretamente, vitórias validadas replicam consistentemente.

A questão prática para equipes menores é tráfego. Se seu site recebe 5.000 visitantes por mês, um teste que precisa de 20.000 visitantes por variante levará oito meses. Naquele tempo, fatores externos como sazonalidade e mudanças de algoritmo contaminam os resultados. Para sites de baixo tráfego, foque em testar mudanças com efeitos esperados grandes (acima de 20% aumento relativo) e use a calculadora-de-ctr para identificar quais fontes de tráfego são grandes o suficiente para executar experimentos válidos.

Ferramentas gratuitas relacionadas

Todas as ferramentas →