Outil gratuit

Significativité d’un test A/B

Une version qui fait mieux qu'une autre ne prouve rien tant qu'on ne sait pas si l'écart tient debout statistiquement. Quatre chiffres, et tu as la réponse.

La significativité statistique d'un test A/B indique la probabilité que l'écart observé entre deux versions ne soit pas dû au hasard. Elle se calcule par un test de comparaison de deux proportions, à partir du nombre de visiteurs et de conversions de chaque version. Le seuil communément retenu est 95 %.

Le nombre de personnes exposées à la version de contrôle.
Les conversions obtenues par la version A.
Le nombre de personnes exposées à la variante.
Les conversions obtenues par la version B.
Niveau de confiance La probabilité que l'écart ne soit pas dû au hasard.
Écart relatif Le gain ou la perte de B par rapport à A.
Taux A Le taux de conversion de la version de contrôle.
Taux B Le taux de conversion de la variante.

L'écart entre B et A, avec sa marge d'erreur

  • Écart fiable à 95 %
  • Dans la marge d'erreur

Ce que le calcul fait

Taux A = Conversions A ÷ Visiteurs A Taux B = Conversions B ÷ Visiteurs B Écart relatif = (Taux B ÷ Taux A) − 1 Confiance = test de comparaison de deux proportions (bilatéral)

5 000 visiteurs et 250 conversions d'un côté (5 %), 5 000 et 300 de l'autre (6 %) : l'écart relatif est de +20 %, et le niveau de confiance de 97,2 %. Au-dessus de 95 %, l'écart est considéré comme significatif.

Le même écart relatif de 20 % sur dix fois moins de trafic ne serait pas concluant. C'est tout l'intérêt du calcul : il sépare la taille de l'écart de la solidité de la preuve, deux choses que l'œil confond systématiquement quand il lit un tableau de résultats.

⚠️ Le test est bilatéral : il répond à « les deux versions diffèrent-elles », pas à « B est-elle meilleure ». Il est symétrique, donc une variante qui perd de 20 % ressort avec la même confiance qu'une variante qui gagne de 20 %.

Les trois façons de se tromper avec un test A/B

  • Arrêter le test dès qu'il passe 95 %. En regardant tous les jours, on finit toujours par franchir le seuil par hasard. La durée du test se fixe AVANT de le lancer, et on ne conclut pas plus tôt.
  • Tester sur moins d'un cycle complet. Le comportement d'achat du lundi n'est pas celui du samedi : un test qui ne couvre pas des semaines entières compare deux jours, pas deux versions.
  • Confondre significatif et important. Avec assez de trafic, un écart de 0,1 point devient significatif sans rien changer au chiffre d'affaires. La confiance dit que l'écart est réel, pas qu'il vaut la peine d'être déployé.

Questions fréquentes

Qu'est-ce qu'un résultat significatif à 95 % ?

Cela veut dire qu'il y a moins de 5 % de chances d'observer un écart de cette taille si les deux versions étaient en réalité identiques. Ce n'est pas la probabilité que B soit meilleure : c'est la probabilité d'un tel écart en l'absence de différence réelle.

Combien de visiteurs faut-il pour conclure ?

Cela dépend du taux de base et de l'écart qu'on veut détecter. Plus le taux est bas et plus l'écart cherché est petit, plus il faut de trafic. Un écart de 20 % sur un taux de 5 % demande quelques milliers de visiteurs par version ; un écart de 5 % en demande des dizaines de milliers.

Peut-on tester plus de deux versions à la fois ?

Oui, mais le calcul ci-dessus compare deux versions. Avec plusieurs variantes, la probabilité qu'au moins une franchisse le seuil par hasard augmente à chaque comparaison ajoutée, et le seuil doit être ajusté en conséquence.

Tes tests créa ne tranchent jamais vraiment ?

C'est presque toujours un problème de volume par variante avant d'être un problème de créa. Le calculateur de test de créatives Meta dit combien tu peux en tester sérieusement avec ton budget.

Obtenir Des Tests Clairs
Théo Maupilé

Partenaire de croissance

Positionnement, acquisition, innovation : on construit ensemble un système de croissance durable.

Théo MaupiléFreelance Paid Media

Google PartnerSuperMalter

◉ Certifications

Partenaire Google Officiel
& SuperMalter