Calculateur de test A/B pour publicités : significativité et taille d'échantillon

Saisissez les visiteurs et conversions de deux versions pour voir si l'écart est réel, ou saisissez votre taux de conversion et l'amélioration qui vous intéresse pour voir combien de visiteurs le test nécessite. Les deux formules sont détaillées, avec des exemples concrets.

Outil gratuit Tout est calculé dans votre navigateur. Rien n'est envoyé, stocké ni enregistré : il n'y a aucun serveur à l'autre bout de cette page.

Deux questions, un calculateur

Chaque test publicitaire pose deux questions, dans cet ordre. Avant le début : combien de visiteurs faut-il pour détecter la différence qui m'intéresse ? Après la fin : l'écart entre A et B est-il réel, ou pourrait-il être dû au hasard ? Utilisez les deux onglets ci-dessus dans cet ordre. C'est le fait de calculer d'abord la taille d'échantillon qui donne du sens à la réponse à la seconde question.

Les « visiteurs » peuvent être les visiteurs d'une page de destination, les clics sur un lien ou toute autre personne ayant eu une chance équitable de convertir, du moment que les deux versions sont comptées de la même manière. Les « conversions » sont les personnes qui ont accompli l'action que vous testez.

Comment fonctionne le test de significativité

Le calculateur effectue un test z à deux proportions, le test pour grands échantillons permettant de comparer deux taux, décrit dans le NIST/SEMATECH e-Handbook of Statistical Methods :

  • Taux groupé p = (conversions A + conversions B) ÷ (visiteurs A + visiteurs B).
  • z = (taux B − taux A) ÷ √(p × (1 − p) × (1/visiteurs A + 1/visiteurs B)).
  • Valeur p bilatérale = 2 × (1 − Φ(|z|)), où Φ est la fonction de répartition de la loi normale centrée réduite.
  • L'intervalle de la différence est (taux B − taux A) ± z × √(taux A × (1 − taux A) ÷ visiteurs A + taux B × (1 − taux B) ÷ visiteurs B). La plage d'amélioration divise ce résultat par le taux A, ce qui suppose le taux A connu : il s'agit donc d'une approximation.

Exemple concret. La version A obtient 200 conversions pour 10 000 visiteurs (2,00 %). La version B en obtient 245 pour 10 000 (2,45 %), soit une amélioration relative de 22,5 %. Le taux groupé est de 445 ÷ 20 000 = 2,225 %, l'erreur type est de 0,209 point de pourcentage et z = 0,45 ÷ 0,209 = 2,157. La valeur p bilatérale est de 0,031, inférieure à 0,05 : à 95 % de confiance, B l'emporte donc. L'intervalle à 95 % de la différence va de +0,04 à +0,86 point de pourcentage : B est meilleure, mais l'amélioration réelle peut se situer entre environ 2 % et 43 %.

Le test est une approximation qui nécessite suffisamment de données. Le manuel du NIST donne un critère : au moins 5 succès et 5 échecs. Le calculateur retient son verdict et indique pas encore assez de données tant que chaque version n'a pas atteint 5 conversions et 5 non-conversions. En deçà, le NIST renvoie à un test exact pour petits échantillons, mais pour un test publicitaire, la réponse pratique est de le laisser tourner.

Comment la taille d'échantillon est calculée

Pour un test bilatéral, visiteurs par version :

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

Ici, p1 est votre taux actuel, p2 est ce taux avec l'amélioration appliquée, et p̄ est leur moyenne. C'est l'approximation normale, sans correction de continuité, et elle a la même forme que la formule de taille d'échantillon à proportion unique du manuel du NIST, avec un second groupe ajouté. À 95 % de confiance, z1−α/2 vaut 1,959964, et à 80 % de puissance, z1−β vaut 0,841621.

Exemple concret. Un taux de conversion de 2 %, et vous voulez détecter une amélioration de 20 %, soit 2,0 % contre 2,4 %. Le taux moyen est de 2,2 %. La ligne du haut est 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, au carré 0,3377, et en divisant par 0,004² on obtient 21 109 visiteurs par version, 42 218 au total. À 3 000 visiteurs par jour, cela représente 15 jours.

L'amélioration que vous visez compte le plus. Sur le même taux de 2 %, une amélioration de 30 % nécessite 9 798 visiteurs par version et une amélioration de 10 % en nécessite 80 682. Diviser l'amélioration par deux quadruple à peu près le trafic, car l'écart figure au carré au dénominateur de la formule.

Pourquoi arrêter tôt gonfle les faux positifs

Un niveau de confiance de 95 % signifie que lorsque A et B convertissent réellement au même rythme, un test unique à taille d'échantillon fixe désigne tout de même un gagnant environ 5 % du temps. Ces 5 % ne sont vrais que si vous regardez une seule fois, à la fin.

Vérifier le résultat chaque jour et s'arrêter dès qu'il affiche significatif est une procédure différente. Les taux fluctuent au fil de l'arrivée des données, et chaque coup d'œil est une nouvelle occasion pour un écart dû au hasard de franchir la ligne. Arrêtez-vous au premier franchissement et vous aurez choisi le moment le plus chanceux : le véritable taux de faux positifs dépasse alors 5 %, et il augmente à mesure que vous regardez souvent. La valeur p affichée à l'écran ignore que vous avez jeté un œil : elle se lit donc comme si vous n'aviez regardé qu'une fois.

La solution est ennuyeuse et elle fonctionne : décidez la taille d'échantillon avant le début du test, laissez-le l'atteindre et lisez le résultat une seule fois. Regarder en cours de route pour vérifier que rien n'est cassé, c'est bien. S'arrêter parce que le chiffre semble bon, non.

Ce que Meta et Google Ads disent de la durée des tests

  • Les bonnes pratiques de test A/B de Meta recommandent des tests d'au moins 7 jours, indiquent que des tests plus courts risquent de donner des résultats non concluants et limitent les tests A/B à 30 jours. La même page suggère d'allonger la durée si les clients mettent généralement plus de 7 jours à convertir.
  • Meta suggère généralement une puissance estimée de 80 % ou plus, la puissance par défaut ici. Ses résultats A/B affichent un pourcentage de confiance, et considère 65 % ou plus comme un résultat gagnant pour un test A/B. Ce chiffre provient de la propre méthode de Meta et n'est pas la même chose que le niveau de confiance de cette page : les deux ne correspondront donc pas.
  • Meta déconseille aussi les tests informels consistant à activer et désactiver des ensembles de publicités, car les audiences peuvent se chevaucher, et recommande le même budget pour les deux versions.
  • Google Ads recommande de laisser une expérimentation tourner de 2 à 3 semaines, affiche par défaut un intervalle de confiance à 80 % avec d'autres niveaux sur demande, et signale les résultats significatifs par un astérisque bleu. Sa méthode statistique utilise le rééchantillonnage jackknife sur 20 groupes par bras : ses intervalles ne correspondront donc pas non plus exactement à un test z.

Ce que ce calculateur ne fait pas

  • Il compare deux versions. Avec trois ou plus, chaque comparaison supplémentaire est une nouvelle occasion de faux gagnant, et le test simple présenté ici ne corrige pas cela.
  • Il teste des taux de conversion, pas le revenu par visiteur ni la valeur de commande, qui nécessitent un autre test.
  • Ce n'est pas un test séquentiel. Il suppose que vous lisez le résultat une seule fois, à la taille d'échantillon prévue.
  • Il ne peut pas dire si votre répartition était équitable. Si une version a reçu une audience, un budget ou un créneau horaire différent, aucune formule ne corrige cela.

Si vous préférez ne pas faire les calculs à la main

Hermoso, c'est le marketing en pilote automatique. Demandez-lui quoi faire monter en puissance, mettre en pause et tester ensuite : il lit chaque plateforme publicitaire que vous avez connectée, place les campagnes trop peu documentées dans un groupe à part au lieu de les juger, et attribue à chaque test suggéré une hypothèse, l'unique élément à changer, la métrique qui tranche, un budget et une durée. Il crée aussi des variantes d'images et de vidéos fidèles à votre marque à tester, et construit des campagnes sur vos propres comptes publicitaires, créées en pause. Il fonctionne dans l'application web, ou au sein de Claude, ChatGPT et Cursor via son serveur MCP. Une fois qu'un test a un gagnant, le calculateur de ROAS gratuit vous dit s'il est aussi rentable.

Outils gratuits: · Calculateur de ROAS · Vérificateur de longueur de texte publicitaire

Questions fréquentes

Comment savoir si mon test A/B publicitaire est statistiquement significatif ?

Saisissez les visiteurs et conversions des deux versions. Le calculateur effectue un test z à deux proportions et donne une valeur p bilatérale. À 95 % de confiance, une valeur p inférieure à 0,05 signifie que l'écart est peu susceptible d'être dû au hasard. Pour 200 sur 10 000 contre 245 sur 10 000, p vaut 0,031, donc B l'emporte.

De combien de visiteurs un test A/B a-t-il besoin ?

Cela dépend de votre taux de conversion et de la plus petite amélioration que vous voulez détecter. À un taux de conversion de 2 %, détecter une amélioration de 20 % à 95 % de confiance et 80 % de puissance nécessite 21 109 visiteurs par version. Une amélioration de 10 % en nécessite 80 682.

Pourquoi le calculateur indique-t-il qu'il n'y a pas encore assez de données ?

Le test z est une approximation pour grands échantillons. Le calculateur attend que chaque version ait au moins 5 conversions et 5 non-conversions, l'un des critères indiqués dans le NIST e-Handbook, avant de rendre un verdict.

Puis-je arrêter un test dès qu'il semble significatif ?

Pas si vous voulez que le niveau de confiance ait le sens annoncé. Vérifier à répétition et s'arrêter à la première lecture significative donne plus d'occasions au hasard de franchir le seuil, si bien que le taux réel de faux positifs finit par être supérieur à celui que vous avez choisi. Fixez d'abord la taille d'échantillon et lisez le résultat une seule fois.

Combien de temps un test A/B Meta doit-il durer ?

Meta recommande au moins 7 jours, précise que des tests plus courts peuvent être non concluants, et autorise jusqu'à 30 jours. Google Ads recommande 2 à 3 semaines pour les expériences. Utilisez l'onglet de taille d'échantillon avec votre trafic quotidien pour voir combien de temps votre propre test nécessite.

Ce que je saisis est-il envoyé quelque part ?

Non. Les calculs s'exécutent dans votre navigateur. Aucune requête réseau ne transmet ce que vous saisissez et rien n'est stocké.

Hermoso vous indique quoi développer, mettre en pause et tester ensuite sur vos comptes publicitaires. Commencez gratuitement, plus de 250 crédits gratuits à gagner, sans carte.

Commencer gratuitement →   Voir les tarifs