Pourquoi estimer les chiffres des tests A/B vous met en difficulté
La plupart des équipes exécutent des tests A/B en estimant les chiffres. La variante A obtient 1 000 visiteurs et 50 conversions (taux de conversion de 5 %). La variante B obtient 1 000 visiteurs et 60 conversions (taux de conversion de 6 %). B gagne, donc ils la mettent en ligne. Le problème est qu'une différence d'un point de pourcentage avec 1 000 visiteurs par variante n'est pas statistiquement significative. Le résultat pourrait s'inverser demain avec le nouveau trafic.
Un calculateur de test A/B effectue les calculs pour séparer le signal du bruit. Il calcule la valeur p (probabilité que la différence soit due au hasard), le niveau de confiance (le degré de certitude), et les intervalles de confiance (la plage où le vrai taux de conversion se situera probablement). Une valeur p inférieure à 0,05 signifie moins de 5 % de chance que le résultat soit aléatoire, ce qui est le seuil standard pour déclarer un gagnant.
Sans le calculateur, vous prenez des décisions sur des données incomplètes. Vous pouvez mettre en ligne une variante perdante parce que vous avez arrêté les tests trop tôt. Vous pouvez continuer à tester un gagnant clair pendant des semaines parce que vous ne faites pas confiance aux chiffres. Le calculateur vous indique exactement quand vous avez suffisamment de données pour décider.
Comment utiliser ce calculateur de test A/B
- Entrez le nombre de visiteurs et de conversions pour la variante A. Les visiteurs sont le nombre de personnes qui ont vu la variante. Les conversions sont le nombre de personnes qui ont complété l'action objectif (inscription, achat, clic, téléchargement). Si vous avez lancé une campagne email où 5 000 personnes ont vu l'email et 200 ont cliqué sur l'appel à l'action, c'est 5 000 visiteurs et 200 conversions.
- Entrez le nombre de visiteurs et de conversions pour la variante B. Utilisez les mêmes métriques que la variante A. Si la variante B a été vue par 5 000 personnes et a obtenu 250 clics, entrez 5 000 visiteurs et 250 conversions.
- Vérifiez les taux de conversion. Le calculateur affiche automatiquement le taux de conversion pour chaque variante (conversions divisées par visiteurs). C'est votre point de départ pour la comparaison.
- Examinez la significativité statistique. La valeur p vous indique si la différence est réelle. Une valeur p inférieure à 0,05 (seuil de significativité de 5 %) signifie que vous pouvez faire confiance au résultat. Une valeur p supérieure à 0,05 signifie que la différence pourrait être aléatoire, donc continuez les tests.
- Regardez l'intervalle de confiance. Cela montre la plage où le vrai taux de conversion se situe probablement. Si la variante A a un intervalle de confiance à 95 % de 3,8 % à 4,2 % et la variante B de 4,5 % à 5,1 %, les plages ne se chevauchent pas, ce qui confirme une différence réelle.
- Vérifiez les recommandations de taille d'échantillon. Si le test n'est pas encore significatif, le calculateur vous indique combien de visiteurs supplémentaires vous avez besoin par variante pour atteindre 95 % de confiance. Utilisez cela pour planifier la durée de l'exécution du test.
Essayez cela avec un test de page d'atterrissage. La variante A (titre original) obtient 10 000 visiteurs et 400 conversions (taux de conversion de 4 %). La variante B (nouveau titre) obtient 10 000 visiteurs et 480 conversions (taux de conversion de 4,8 %). Le calculateur affiche une valeur p de 0,03, ce qui signifie 97 % de confiance que la variante B est meilleure. Vous mettez en ligne le nouveau titre et attendez un gain constant.
Pourquoi la significativité statistique importe plus que le taux de conversion seul
Le taux de conversion vous indique ce qui s'est passé. La significativité statistique vous indique si cela continuera à se produire. Un taux de conversion de 10 % qui fluctue entre 8 % et 12 % jour après jour est moins utile qu'un taux stable de 9 % avec des intervalles de confiance serrés.
Google a exécuté 12 000 tests A/B en 2023 et a trouvé que 30 % des tests appelés « gagnants » tôt auraient été inversés s'ils avaient été prolongés. Les équipes se sont arrêtées à 1 000 visiteurs par variante parce que la variante B était en avance de 15 %. La valeur p était 0,12 (88 % de confiance, pas 95 %). Quand ils ont laissé le test fonctionner jusqu'à 5 000 visiteurs, la variante A s'est retrouvée en tête. L'appeler tôt signifiait simplement l'appeler mal.
La taille de l'échantillon détermine si vous pouvez faire confiance au résultat. Les petits tests (moins de 500 conversions au total) produisent des intervalles de confiance larges, ce qui signifie que le vrai taux de conversion pourrait être n'importe où dans une large gamme. Les grands tests (plus de 5 000 conversions) produisent des intervalles serrés, ce qui signifie que vous connaissez le vrai taux à quelques décimales près. Le calculateur affiche à la fois les intervalles et la taille d'échantillon recommandée pour que vous sachiez quand arrêter.
Effectuer les calculs change vos habitudes de test. Vous arrêtez d'appeler les gagnants sur intuition : un gain de 20 % ne signifie rien si la valeur p est 0,15. Vous arrêtez de faire des tests après la significativité : une fois que vous atteignez p < 0,05 et la taille d'échantillon recommandée, vous avez votre réponse. Et vous arrêtez de tuer les tests trop tôt, parce qu'une variante qui est derrière après 1 000 visiteurs n'a pas encore réellement perdu.
Erreurs courantes
- Arrêter les tests trop tôt. Une variante prend l'avance après 500 visiteurs, alors vous l'appelez et passez à autre chose. Le problème est que 500 visiteurs produisent rarement une significativité statistique à moins que la différence de taux de conversion ne soit massive (comme 2 % vs 6 %). Laissez le test fonctionner jusqu'à ce que la valeur p baisse en dessous de 0,05 ou que vous atteigniez la taille d'échantillon recommandée.
- Ignorer l'intervalle de confiance. Deux variantes pourraient avoir des taux de conversion différents mais des intervalles de confiance qui se chevauchent, ce qui signifie que la différence n'est pas réelle. Vérifiez toujours que les intervalles sont séparés avant de déclarer un gagnant.
- Tester trop de variantes à la fois. Exécuter des tests A/B/C/D divise le trafic en quatre, ce qui signifie que chaque variante a besoin de quatre fois plus de visiteurs pour atteindre la significativité. Concentrez-vous sur les tests A/B à moins d'avoir un trafic massif.
- Changer le test en cours d'exécution. Vous commencez à tester un titre, puis à mi-chemin vous changez aussi la couleur du bouton. Maintenant vous ne savez pas quel changement a causé la différence. Testez une variable à la fois ou utilisez des outils de test multivariés conçus pour les changements multiples.
- Ne pas utiliser la même période. Exécuter la variante A lundi et la variante B vendredi introduit un biais du jour de la semaine. La qualité du trafic, l'intention de l'utilisateur et les taux de conversion varient selon le jour. Exécutez les deux variantes simultanément avec un trafic divisé 50/50.
- Confondre la significativité statistique avec l'impact commercial. Un test peut être statistiquement significatif mais économiquement sans sens. Un gain de 0,1 % sur un produit à faible marge pourrait ne pas couvrir le coût de mise en œuvre. Utilisez le calculateur de taux de conversion pour projeter l'impact sur les revenus avant de mettre en ligne.
Conseils avancés
- Combinez ce calculateur avec le calculateur de taux de conversion pour traduire les gains en pourcentage en revenus. Si la variante B augmente la conversion de 4 % à 4,8 % et vous recevez 100 000 visiteurs par mois, c'est 800 conversions supplémentaires. Multipliez par la valeur de commande moyenne pour voir l'impact en dollars.
- Utilisez la taille d'échantillon recommandée pour estimer la durée du test. Si vous avez besoin de 15 000 visiteurs par variante pour atteindre la significativité et vous recevez 5 000 visiteurs par jour, le test doit fonctionner au minimum six jours (15 000 × 2 variantes ÷ 5 000 par jour).
- Pour les tests séquentiels (tester le gagnant contre un nouveau challenger), réinitialisez le calculateur. Ne reportez pas les données du test précédent. Chaque test est indépendant et a besoin de sa propre taille d'échantillon pour des résultats valides.
- Suivez la significativité dans le temps en recalculant quotidiennement. Exportez la valeur p et les intervalles de confiance vers une feuille de calcul pour voir le moment où le test franchit le seuil de confiance à 95 %. Cela prévient les appels prématurés et confirme quand vous avez collecté suffisamment de données.
- Pour les tests avec peu de trafic, abaissez votre seuil de significativité de 0,05 à 0,10 (90 % de confiance). C'est plus risqué mais nécessaire quand attendre 95 % de confiance prendrait des mois. Documentez le compromis et attendez-vous à plus de faux positifs.
- Si un test s'exécute pendant des semaines et n'atteint jamais la significativité, les variantes sont probablement trop similaires. La différence de taux de conversion est si petite que la détecter nécessite des tailles d'échantillon irréalistes. Appelez-le une égalité et testez un changement plus important.
Une fois que vous avez déterminé la significativité statistique, l'étape suivante consiste à comprendre d'où proviennent les conversions. Utilisez le calculateur CTR pour décomposer les taux de clic par source de trafic, appareil ou campagne. Si vous testez les lignes d'objet des emails, le taux de conversion montre qui a agit après l'ouverture, mais le CTR montre qui a ouvert en premier lieu. Pour les workflows d'optimisation de page d'atterrissage, ce calculateur confirme si un changement a fonctionné, le calculateur de taux de conversion projette l'impact sur les revenus, et le générateur de titre vous aide à écrire la prochaine variante à tester.