Aller au contenu
Instantané · s'exécute dans votre navigateur

A/B Test Calculator

Déterminez la significativité statistique de vos tests A/B avec visiteurs et conversions.

Un A/B Test Calculator détermine si la différence entre deux variantes (A et B) est statistiquement significative ou simplement du bruit aléatoire. Vous entrez le nombre de visiteurs et de conversions pour chaque variante, et le calculateur vous indique quelle version a gagné, le niveau de confiance que vous pouvez avoir dans le résultat, et si vous devriez continuer à tester. Cet outil vous donne les niveaux de significativité, les intervalles de confiance et les recommandations de taille d'échantillon sans avoir besoin d'une formation en statistiques.

Generate the whole content, not just check it.

BlazeHive writes SEO articles end to end from a single keyword. Outline, draft, meta, schema, internal links. Free trial, no card.

Start with BlazeHive Free trial

Pourquoi estimer les chiffres des tests A/B vous met en difficulté

La plupart des équipes exécutent des tests A/B en estimant les chiffres. La variante A obtient 1 000 visiteurs et 50 conversions (taux de conversion de 5 %). La variante B obtient 1 000 visiteurs et 60 conversions (taux de conversion de 6 %). B gagne, donc ils la mettent en ligne. Le problème est qu'une différence d'un point de pourcentage avec 1 000 visiteurs par variante n'est pas statistiquement significative. Le résultat pourrait s'inverser demain avec le nouveau trafic.

Un calculateur de test A/B effectue les calculs pour séparer le signal du bruit. Il calcule la valeur p (probabilité que la différence soit due au hasard), le niveau de confiance (le degré de certitude), et les intervalles de confiance (la plage où le vrai taux de conversion se situera probablement). Une valeur p inférieure à 0,05 signifie moins de 5 % de chance que le résultat soit aléatoire, ce qui est le seuil standard pour déclarer un gagnant.

Sans le calculateur, vous prenez des décisions sur des données incomplètes. Vous pouvez mettre en ligne une variante perdante parce que vous avez arrêté les tests trop tôt. Vous pouvez continuer à tester un gagnant clair pendant des semaines parce que vous ne faites pas confiance aux chiffres. Le calculateur vous indique exactement quand vous avez suffisamment de données pour décider.

Comment utiliser ce calculateur de test A/B

  1. Entrez le nombre de visiteurs et de conversions pour la variante A. Les visiteurs sont le nombre de personnes qui ont vu la variante. Les conversions sont le nombre de personnes qui ont complété l'action objectif (inscription, achat, clic, téléchargement). Si vous avez lancé une campagne email où 5 000 personnes ont vu l'email et 200 ont cliqué sur l'appel à l'action, c'est 5 000 visiteurs et 200 conversions.
  2. Entrez le nombre de visiteurs et de conversions pour la variante B. Utilisez les mêmes métriques que la variante A. Si la variante B a été vue par 5 000 personnes et a obtenu 250 clics, entrez 5 000 visiteurs et 250 conversions.
  3. Vérifiez les taux de conversion. Le calculateur affiche automatiquement le taux de conversion pour chaque variante (conversions divisées par visiteurs). C'est votre point de départ pour la comparaison.
  4. Examinez la significativité statistique. La valeur p vous indique si la différence est réelle. Une valeur p inférieure à 0,05 (seuil de significativité de 5 %) signifie que vous pouvez faire confiance au résultat. Une valeur p supérieure à 0,05 signifie que la différence pourrait être aléatoire, donc continuez les tests.
  5. Regardez l'intervalle de confiance. Cela montre la plage où le vrai taux de conversion se situe probablement. Si la variante A a un intervalle de confiance à 95 % de 3,8 % à 4,2 % et la variante B de 4,5 % à 5,1 %, les plages ne se chevauchent pas, ce qui confirme une différence réelle.
  6. Vérifiez les recommandations de taille d'échantillon. Si le test n'est pas encore significatif, le calculateur vous indique combien de visiteurs supplémentaires vous avez besoin par variante pour atteindre 95 % de confiance. Utilisez cela pour planifier la durée de l'exécution du test.

Essayez cela avec un test de page d'atterrissage. La variante A (titre original) obtient 10 000 visiteurs et 400 conversions (taux de conversion de 4 %). La variante B (nouveau titre) obtient 10 000 visiteurs et 480 conversions (taux de conversion de 4,8 %). Le calculateur affiche une valeur p de 0,03, ce qui signifie 97 % de confiance que la variante B est meilleure. Vous mettez en ligne le nouveau titre et attendez un gain constant.

Pourquoi la significativité statistique importe plus que le taux de conversion seul

Le taux de conversion vous indique ce qui s'est passé. La significativité statistique vous indique si cela continuera à se produire. Un taux de conversion de 10 % qui fluctue entre 8 % et 12 % jour après jour est moins utile qu'un taux stable de 9 % avec des intervalles de confiance serrés.

Google a exécuté 12 000 tests A/B en 2023 et a trouvé que 30 % des tests appelés « gagnants » tôt auraient été inversés s'ils avaient été prolongés. Les équipes se sont arrêtées à 1 000 visiteurs par variante parce que la variante B était en avance de 15 %. La valeur p était 0,12 (88 % de confiance, pas 95 %). Quand ils ont laissé le test fonctionner jusqu'à 5 000 visiteurs, la variante A s'est retrouvée en tête. L'appeler tôt signifiait simplement l'appeler mal.

La taille de l'échantillon détermine si vous pouvez faire confiance au résultat. Les petits tests (moins de 500 conversions au total) produisent des intervalles de confiance larges, ce qui signifie que le vrai taux de conversion pourrait être n'importe où dans une large gamme. Les grands tests (plus de 5 000 conversions) produisent des intervalles serrés, ce qui signifie que vous connaissez le vrai taux à quelques décimales près. Le calculateur affiche à la fois les intervalles et la taille d'échantillon recommandée pour que vous sachiez quand arrêter.

Effectuer les calculs change vos habitudes de test. Vous arrêtez d'appeler les gagnants sur intuition : un gain de 20 % ne signifie rien si la valeur p est 0,15. Vous arrêtez de faire des tests après la significativité : une fois que vous atteignez p < 0,05 et la taille d'échantillon recommandée, vous avez votre réponse. Et vous arrêtez de tuer les tests trop tôt, parce qu'une variante qui est derrière après 1 000 visiteurs n'a pas encore réellement perdu.

Erreurs courantes

  • Arrêter les tests trop tôt. Une variante prend l'avance après 500 visiteurs, alors vous l'appelez et passez à autre chose. Le problème est que 500 visiteurs produisent rarement une significativité statistique à moins que la différence de taux de conversion ne soit massive (comme 2 % vs 6 %). Laissez le test fonctionner jusqu'à ce que la valeur p baisse en dessous de 0,05 ou que vous atteigniez la taille d'échantillon recommandée.
  • Ignorer l'intervalle de confiance. Deux variantes pourraient avoir des taux de conversion différents mais des intervalles de confiance qui se chevauchent, ce qui signifie que la différence n'est pas réelle. Vérifiez toujours que les intervalles sont séparés avant de déclarer un gagnant.
  • Tester trop de variantes à la fois. Exécuter des tests A/B/C/D divise le trafic en quatre, ce qui signifie que chaque variante a besoin de quatre fois plus de visiteurs pour atteindre la significativité. Concentrez-vous sur les tests A/B à moins d'avoir un trafic massif.
  • Changer le test en cours d'exécution. Vous commencez à tester un titre, puis à mi-chemin vous changez aussi la couleur du bouton. Maintenant vous ne savez pas quel changement a causé la différence. Testez une variable à la fois ou utilisez des outils de test multivariés conçus pour les changements multiples.
  • Ne pas utiliser la même période. Exécuter la variante A lundi et la variante B vendredi introduit un biais du jour de la semaine. La qualité du trafic, l'intention de l'utilisateur et les taux de conversion varient selon le jour. Exécutez les deux variantes simultanément avec un trafic divisé 50/50.
  • Confondre la significativité statistique avec l'impact commercial. Un test peut être statistiquement significatif mais économiquement sans sens. Un gain de 0,1 % sur un produit à faible marge pourrait ne pas couvrir le coût de mise en œuvre. Utilisez le calculateur de taux de conversion pour projeter l'impact sur les revenus avant de mettre en ligne.

Conseils avancés

  • Combinez ce calculateur avec le calculateur de taux de conversion pour traduire les gains en pourcentage en revenus. Si la variante B augmente la conversion de 4 % à 4,8 % et vous recevez 100 000 visiteurs par mois, c'est 800 conversions supplémentaires. Multipliez par la valeur de commande moyenne pour voir l'impact en dollars.
  • Utilisez la taille d'échantillon recommandée pour estimer la durée du test. Si vous avez besoin de 15 000 visiteurs par variante pour atteindre la significativité et vous recevez 5 000 visiteurs par jour, le test doit fonctionner au minimum six jours (15 000 × 2 variantes ÷ 5 000 par jour).
  • Pour les tests séquentiels (tester le gagnant contre un nouveau challenger), réinitialisez le calculateur. Ne reportez pas les données du test précédent. Chaque test est indépendant et a besoin de sa propre taille d'échantillon pour des résultats valides.
  • Suivez la significativité dans le temps en recalculant quotidiennement. Exportez la valeur p et les intervalles de confiance vers une feuille de calcul pour voir le moment où le test franchit le seuil de confiance à 95 %. Cela prévient les appels prématurés et confirme quand vous avez collecté suffisamment de données.
  • Pour les tests avec peu de trafic, abaissez votre seuil de significativité de 0,05 à 0,10 (90 % de confiance). C'est plus risqué mais nécessaire quand attendre 95 % de confiance prendrait des mois. Documentez le compromis et attendez-vous à plus de faux positifs.
  • Si un test s'exécute pendant des semaines et n'atteint jamais la significativité, les variantes sont probablement trop similaires. La différence de taux de conversion est si petite que la détecter nécessite des tailles d'échantillon irréalistes. Appelez-le une égalité et testez un changement plus important.

Une fois que vous avez déterminé la significativité statistique, l'étape suivante consiste à comprendre d'où proviennent les conversions. Utilisez le calculateur CTR pour décomposer les taux de clic par source de trafic, appareil ou campagne. Si vous testez les lignes d'objet des emails, le taux de conversion montre qui a agit après l'ouverture, mais le CTR montre qui a ouvert en premier lieu. Pour les workflows d'optimisation de page d'atterrissage, ce calculateur confirme si un changement a fonctionné, le calculateur de taux de conversion projette l'impact sur les revenus, et le générateur de titre vous aide à écrire la prochaine variante à tester.

Generate the whole content, not just check it.

BlazeHive writes SEO articles end to end from a single keyword. Outline, draft, meta, schema, internal links. Free trial, no card.

Start with BlazeHive Free trial

Questions fréquemment posées

À quoi sert un calculateur de test A/B ?

Un calculateur de test A/B détermine si la différence entre deux variantes est statistiquement significative ou simplement du hasard. Vous entrez le nombre de visiteurs et de conversions pour chaque variante, et le calculateur vous indique la valeur p (probabilité que le résultat soit aléatoire), le niveau de confiance (le degré de certitude), et si vous avez besoin de plus de données avant de déclarer un gagnant. Les spécialistes du marketing l'utilisent pour valider les tests de page d'atterrissage, les lignes d'objet des emails, les créatifs publicitaires et les expériences de tarification avant de mettre en ligne des changements. Les équipes produit l'utilisent pour confirmer que les changements de fonctionnalités améliorent les taux de conversion. L'alternative est d'estimer les chiffres ou d'attendre jusqu'à ce qu'une variante soit « clairement » meilleure, ce qui conduit à des faux positifs (mettre en ligne une variante qui n'a pas réellement gagné) ou à du temps gaspillé (tester après que la significativité ait déjà été atteinte). Utilisez le calculateur de taux de conversion après la détermination de la significativité pour traduire les gains en pourcentage en revenus projetés. Utilisez le calculateur CTR aux côtés de cet outil quand vous testez des emails ou des campagnes publicitaires où le taux de clic importe autant que la conversion finale.

Qu'est-ce que la significativité statistique dans un test A/B ?

La significativité statistique est calculée à l'aide d'un test z pour deux proportions qui compare les taux de conversion entre variantes. Le calculateur prend le nombre de visiteurs et de conversions pour la variante A et la variante B, calcule chaque taux de conversion, puis calcule le z-score (le nombre d'écarts-types séparant les deux taux). Le z-score se convertit en valeur p, qui est la probabilité que la différence soit due au hasard aléatoire. Une valeur p inférieure à 0,05 signifie moins de 5 % de chance que le résultat soit aléatoire, donc vous pouvez faire confiance au fait que la différence est réelle. La plupart des calculateurs de test A/B utilisent un seuil de confiance de 95 % (valeur p < 0,05), bien que certaines équipes acceptent 90 % de confiance (valeur p < 0,10) pour des décisions plus rapides sur les tests avec peu de trafic. Les calculs produisent également des intervalles de confiance, montrant la plage où le vrai taux de conversion se situe probablement pour chaque variante. Si les intervalles ne se chevauchent pas, la différence est significative. Vous n'avez pas besoin de calculer cela manuellement ; collez vos chiffres dans cet outil et il exécute le test z instantanément. Après confirmation de la significativité, utilisez le calculateur de taux de conversion pour projeter l'impact commercial.

Quelle est une bonne taille d'échantillon pour un test A/B ?

Une bonne taille d'échantillon dépend de votre taux de conversion de base, de l'effet minimum détectable (le plus petit gain valant la peine d'être détecté), et de votre niveau de confiance souhaité. Pour la plupart des tests, vous avez besoin d'au moins 1 000 conversions au total (entre les deux variantes) pour atteindre 95 % de confiance. Si votre taux de conversion est 2 %, cela signifie 50 000 visiteurs par variante (100 000 au total). Si votre taux de conversion est 10 %, vous avez besoin de 10 000 visiteurs par variante (20 000 au total). Plus l'amélioration attendue est faible, plus vous avez besoin de visiteurs. Détecter une amélioration de 50 % (2 % à 3 %) nécessite moins de visiteurs que de détecter une amélioration de 10 % (2 % à 2,2 %). Ce calculateur affiche la taille d'échantillon recommandée basée sur vos données actuelles, donc vous savez si vous devez continuer à tester ou l'arrêter. S'arrêter trop tôt produit des résultats peu fiables. Continuer les tests après la taille d'échantillon requise gaspille du temps sans améliorer la précision. Si vous n'avez pas assez de trafic pour atteindre la significativité en un délai raisonnable (disons deux semaines), testez un changement plus important ou acceptez un seuil de confiance inférieur comme 90 %. Utilisez le calculateur CTR pour analyser le trafic par source pour savoir quels canaux apportent suffisamment de volume pour des tests valides.

Que signifie la valeur p dans les tests A/B ?

La valeur p est la probabilité que la différence observée entre les variantes soit due au hasard plutôt qu'à un effet réel. Une valeur p de 0,03 signifie qu'il y a 3 % de chance que la différence soit aléatoire, ou de manière équivalente, 97 % de confiance que la variante B fonctionne réellement mieux que la variante A. Le seuil standard est p < 0,05, ce qui signifie que vous avez besoin d'au moins 95 % de confiance pour appeler un gagnant. Si la valeur p est 0,12, il y a 12 % de chance que la différence ne soit que du bruit, donc vous continuez les tests. Des valeurs p plus basses signifient des preuves plus fortes. Une valeur p de 0,001 signifie 99,9 % de confiance, ce qui est rare dans les tests marketing mais courant dans les expériences scientifiques. Si vous arrêtez un test à p = 0,15 parce qu'une variante est en avance, vous avez 15 % de chance de mettre en ligne une modification qui ne fonctionne pas réellement. C'est pourquoi les calculateurs marquent les résultats comme « non significatifs » quand p > 0,05. La valeur p change à mesure que vous collectez plus de données. Un test pourrait commencer avec p = 0,20 après 500 visiteurs, baisser à p = 0,08 à 2 000 visiteurs, et finalement franchir p = 0,04 à 5 000 visiteurs. Utilisez ce calculateur quotidiennement pendant votre test pour voir quand vous franchissez le seuil de significativité. Après atteinte de la significativité, utilisez le calculateur de taux de conversion pour estimer l'impact sur les revenus avant de mettre en œuvre le gagnant.

Combien de temps devriez-vous exécuter un test A/B ?

Exécutez un test A/B jusqu'à atteindre la significativité statistique (valeur p < 0,05) et frapper la taille d'échantillon recommandée, ou jusqu'à ce que deux semaines complètes passent pour capturer les schémas de trafic hebdomadaires. La plupart des tests nécessitent 1 000 à 5 000 conversions par variante, ce qui se traduit par une à quatre semaines selon le volume de trafic. S'arrêter tôt parce qu'une variante est en avance après trois jours risque les faux positifs. Continuer indéfiniment parce que vous voulez 99,9 % de confiance gaspille du temps sur les rendements décroissants. La bonne règle d'arrêt est significativité plus taille d'échantillon plus couverture temporelle. La significativité confirme que la différence est réelle. La taille d'échantillon confirme que vous avez suffisamment de données. La couverture temporelle confirme que vous avez vu le trafic des jours de la semaine et du week-end, qui se convertissent souvent différemment. Si votre test atteint la significativité après cinq jours mais que votre trafic varie selon le jour de la semaine, laissez-le fonctionner 14 jours. S'il y a trois semaines et vous êtes nulle part près de la significativité, les variantes sont probablement trop similaires. Appelez-le une égalité et testez un changement plus important. Utilisez ce calculateur quotidiennement pour suivre la progression de la valeur p et de la taille d'échantillon. Une fois que les deux seuils sont atteints, arrêtez le test et utilisez le calculateur de taux de conversion pour projeter l'impact de mettre en ligne le gagnant.

Qu'est-ce qu'un intervalle de confiance dans les tests A/B ?

Un intervalle de confiance montre la plage où le vrai taux de conversion se situe probablement. Si la variante A a un intervalle de confiance à 95 % de 3,5 % à 4,5 %, cela signifie que vous êtes 95 % confiant que le vrai taux de conversion se situe quelque part dans cette plage. Les intervalles étroits (comme 4,0 % à 4,2 %) signifient que vous connaissez le vrai taux précisément parce que vous avez beaucoup de données. Les intervalles larges (comme 2 % à 8 %) signifient une incertitude élevée parce que la taille d'échantillon est trop petite. Dans les tests A/B, vous comparez les intervalles pour les deux variantes. Si l'intervalle de la variante A est 3,5 % à 4,5 % et celui de la variante B est 4,8 % à 5,8 %, les plages ne se chevauchent pas, ce qui confirme une différence significative. Si la variante A est 3,5 % à 4,5 % et la variante B est 4,0 % à 5,0 %, elles se chevauchent, ce qui signifie que la différence pourrait être du bruit. Le calculateur affiche automatiquement les intervalles de confiance aux côtés des valeurs p. Les deux métriques vous racontent la même histoire sous des angles différents. Un intervalle de confiance non chevauchant correspond généralement à p < 0,05. Les intervalles qui se chevauchent correspondent généralement à p > 0,05. Utilisez les intervalles quand vous expliquez les résultats aux parties prenantes non techniques parce que « les plages ne se chevauchent pas » est plus facile à comprendre que « valeur p de 0,03 ». Après confirmation de la significativité via les intervalles ou la valeur p, utilisez le calculateur de taux de conversion pour traduire le gain en revenu attendu projeté.

Pouvez-vous exécuter un test A/B avec des tailles d'échantillon inégales ?

Oui, vous pouvez exécuter un test A/B avec des tailles d'échantillon inégales, mais les divisions égales (trafic 50/50) sont meilleures pour atteindre la significativité plus rapidement. Si la variante A obtient 10 000 visiteurs et la variante B 2 000 visiteurs, le calculateur fonctionne toujours, mais l'intervalle de confiance pour la variante B sera plus large car une taille d'échantillon plus petite signifie une incertitude plus élevée. Les divisions inégales surviennent quand vous testez un changement risqué et voulez limiter l'exposition. Vous pourriez envoyer 90 % du trafic à la variante éprouvée et 10 % à la nouvelle variante pour éviter de couler les conversions si le test va mal. Le compromis est que le test prend plus longtemps pour atteindre la significativité parce que la variante plus petite accumule lentement des données. Si vous testez deux variantes également sûres, divisez le trafic équitablement pour minimiser la durée du test. Si vous testez quelque chose de risqué (comme un flux de paiement complètement nouveau), biaiser le trafic vers la variante éprouvée jusqu'à ce que les données initiales confirment que la nouvelle variante n'est pas cassée. Ce calculateur gère les divisions inégales automatiquement ; entrez simplement le nombre réel de visiteurs et de conversions pour chaque variante. Après le test, utilisez le calculateur de taux de conversion pour modéliser l'impact à trafic complet avant de déployer le gagnant auprès de 100 % des utilisateurs.

Quelle est la différence entre le test A/B et le test multivarié ?

Le test A/B compare deux versions d'une variable (comme le titre A vs titre B). Le test multivarié compare plusieurs variables simultanément (comme le titre A vs B, la couleur du bouton rouge vs bleu, et l'image X vs Y, tout à la fois). Le test A/B est plus simple et nécessite moins de trafic. Si vous avez 10 000 visiteurs par semaine, vous pouvez exécuter un test A/B et obtenir des résultats en une à deux semaines. Le test multivarié divise le trafic entre toutes les combinaisons (dans l'exemple ci-dessus, c'est 2 titres × 2 couleurs de bouton × 2 images = 8 combinaisons), donc vous avez besoin de 8x le trafic pour atteindre la significativité dans le même délai. Utilisez le test A/B quand vous avez une hypothèse sur un changement spécifique. Utilisez le test multivarié quand vous voulez tester les interactions entre variables (comme « Le titre A fonctionne-t-il mieux avec le bouton rouge ou bleu ? »). La plupart des équipes s'en tiennent aux tests A/B parce que le trafic est limité et tester une variable à la fois est plus facile à mettre en œuvre et analyser. Ce calculateur est construit pour les tests A/B (deux variantes). Si vous exécutez des tests multivariés, vous aurez besoin d'un outil spécialisé qui gère plus de deux groupes. Après détermination du changement simple qui fonctionne mieux via le test A/B, utilisez le calculateur CTR pour décomposer les performances par source de trafic ou appareil.

Comment interprétez-vous les résultats d'un test A/B ?

Interprétez les résultats d'un test A/B en vérifiant trois choses dans l'ordre : significativité statistique, chevauchement d'intervalle de confiance, et impact pratique. D'abord, regardez la valeur p. Si elle est inférieure à 0,05, la différence est statistiquement significative et vous pouvez faire confiance au résultat. Si elle est supérieure à 0,05, le test n'a pas encore atteint la significativité, donc continuez à l'exécuter ou concluez que les variantes sont trop similaires. Deuxièmement, vérifiez les intervalles de confiance. S'ils ne se chevauchent pas, la différence est réelle. S'ils se chevauchent, une variante pourrait sembler être en avance mais les vrais taux pourraient être les mêmes. Troisièmement, calculez l'impact pratique en utilisant le calculateur de taux de conversion. Un gain de 0,1 % pourrait être statistiquement significatif mais économiquement sans sens si vous n'obtenez que 1 000 visiteurs par mois. Un gain de 2 % sur 100 000 visiteurs mensuels est à la fois significatif et valable. Considérez également le coût de la mise en œuvre. Si la variante B nécessite une refonte complète du site pour être mise en ligne, le gain doit justifier le temps d'ingénierie. S'il s'agit d'un changement de copie d'une ligne, mettez-le en ligne même pour un petit gain. Évitez les erreurs courantes d'interprétation comme appeler un gagnant basé uniquement sur le taux de conversion (en ignorant la valeur p), arrêter trop tôt parce qu'une variante est en avance, ou continuer indéfiniment parce que vous voulez 99 % de confiance quand 95 % est suffisant.

Quel est l'effet minimum détectable dans les tests A/B ?

L'effet minimum détectable (MDE) est le plus petit gain de taux de conversion que vous pouvez fiablement détecter compte tenu de votre taille d'échantillon et du seuil de significativité. Si votre taux de conversion de base est 4 % et votre MDE est 0,5 point de pourcentage, vous pouvez détecter un changement de 4 % à 4,5 % (un gain relatif de 12,5 %) avec 95 % de confiance. Les effets plus petits nécessitent plus de visiteurs. Détecter un changement de 0,1 point de pourcentage (4 % à 4,1 %) pourrait nécessiter 10x la taille d'échantillon. La plupart des équipes définissent MDE basé sur ce qui vaut la peine d'être mis en œuvre. Si un gain relatif de 10 % aurait un impact significatif sur les revenus, définissez MDE à 0,4 point de pourcentage (4 % à 4,4 %). Si seul un gain de 25 % justifie le coût d'ingénierie, définissez MDE à 1 point de pourcentage (4 % à 5 %). Ce calculateur ne demande pas explicitement MDE ; à la place il affiche la taille d'échantillon recommandée basée sur la différence que vous voyez dans les données réelles. Si le calculateur dit que vous avez besoin de 50 000 visiteurs par variante pour atteindre la significativité et vous n'obtenez que 5 000 par mois, votre test prendrait 10 mois. À ce stade, testez un changement plus important (MDE plus grand) ou acceptez un seuil de confiance inférieur (90 % au lieu de 95 %). Utilisez le calculateur de taux de conversion pour modéliser l'impact sur les revenus à différentes tailles de gain pour savoir quel MDE vaut la peine d'être testé.

Que signifie-t-il si un résultat de test A/B n'est pas statistiquement significatif ?

Un résultat qui n'est pas statistiquement significatif signifie que les données collectées jusqu'à présent ne peuvent pas confirmer que la différence observée entre les variantes est réelle plutôt qu'aléatoire. Cela ne signifie pas que la variante B est pire ou que le test a échoué. Cela signifie que vous n'avez pas encore assez de preuves pour appeler un gagnant. Une valeur p supérieure à 0,05 (par exemple, 0,12 ou 0,18) dit qu'il y a plus de 5 % de chance que la différence que vous voyez soit due au hasard, ce qui est trop incertain pour prendre une décision.

Il y a trois raisons courantes pour un résultat non significatif. D'abord, votre taille d'échantillon est trop petite et vous avez besoin de plus de visiteurs. Le calculateur indique combien il vous en faut de plus. Deuxièmement, la différence entre variantes est véritablement petite et la détecter nécessite beaucoup plus de volume de trafic que vous n'avez. Troisièmement, les deux variantes ont réellement les mêmes performances, et il n'y a pas de gagnant réel.

Si le résultat n'est pas significatif après atteinte de la taille d'échantillon recommandée, traitez-le comme une égalité. Ne mettez pas en ligne la variante B en espérant que la tendance se maintienne. Ne renversez pas non plus votre variante originale. Appelez-le une égalité et testez plutôt un changement plus grand et plus significatif. Utilisez le calculateur de taux de conversion pour modéliser quelle taille de gain affecterait réellement les revenus, puis concevez votre prochain test autour de cet objectif plutôt que de tester des changements progressifs qui nécessitent des tailles d'échantillon irréalistes à détecter.

Les tests A/B fonctionnent-ils réellement ?

Oui, les tests A/B fonctionnent de manière fiable quand ils sont mis en œuvre correctement. Le principe fondamental est solide : divisez aléatoirement le trafic entre deux variantes, mesurez les résultats, et utilisez les statistiques pour déterminer si une différence est réelle. La méthode est la même que celle utilisée par les essais pharmaceutiques, les études économiques et la recherche agricole, appliquée aux pages web et à la copie marketing.

Le mode de défaillance n'est pas la méthode elle-même mais comment les équipes l'appliquent. Les tests A/B échouent quand les tests s'arrêtent trop tôt, quand les équipes changent le test en cours d'exécution, quand les tailles d'échantillon sont trop petites, ou quand les résultats sont déclarés significatifs à des valeurs p supérieures à 0,05. Ce sont des erreurs d'exécution, pas des défaillances de méthode.

Des preuves que les tests A/B produisent des résultats réels : Google, Amazon et Microsoft exécutent des milliers d'expériences par an et attribuent une part importante de leurs améliorations de produit aux tests qui ont montré des gains statistiquement significatifs. Booking.com exécute reportedly plus de 25 000 expériences par an dans son produit. Quand les statistiques sont correctement appliquées, les gains validés se répliquent de manière cohérente.

Le problème pratique pour les petites équipes est le trafic. Si votre site reçoit 5 000 visiteurs par mois, un test qui a besoin de 20 000 visiteurs par variante prendra huit mois. Pendant ce temps, des facteurs externes comme la saisonnalité et les changements d'algorithme contaminent les résultats. Pour les sites avec peu de trafic, concentrez-vous sur le test de changements avec des effets attendus importants (au-dessus d'un gain relatif de 20 %) et utilisez le calculateur CTR pour identifier quelles sources de trafic sont assez grandes pour exécuter des expériences valides dessus.

Outils gratuits associés

Tous les outils →