La formule
Interpreter le resultat
Une p-value inférieure à 0,05 est le seuil conventionnel de signification, correspondant à un z-score au-delà de ±1,96. Cela signifie qu'une différence de cette ampleur se produirait par hasard dans moins de 5 % des cas si les variantes étaient identiques.
Ou cela se complique. Vérifier le test de façon répétée et s'arrêter dès qu'il devient significatif gonfle considérablement le taux de faux positifs. Fixez la taille de l'échantillon à l'avance, ou utilisez une méthode de test séquentiel conçue pour une surveillance continue.
Que la différence observée est peu susceptible de résulter du seul hasard. Cela ne dit rien sur le point de savoir si la différence est suffisamment importante pour avoir un intérêt commercial.
Jusqu'à atteindre la taille d'échantillon préalablement calculée, et pendant au moins une semaine complète pour couvrir les effets liés au jour de la semaine. S'arrêter trop tôt sur un résultat prometteur est la façon la plus courante d'aboutir à une conclusion erronée.
Comment calculer
Il s'agit du test z standard sur deux proportions, utilisé pour déterminer si le résultat d'un test A/B est réel ou dû au hasard. Il compare la différence observée à l'ampleur de la différence que produirait à elle seule la variation aléatoire.
La probabilité de queue normale est calculée à l'aide de la série de Zelen et Severo, précise à environ sept décimales près — la même méthode qu'utilisent les logiciels statistiques lorsqu'aucune routine exacte n'est disponible.