Significativité statistique
Un résultat est statistiquement significatif quand l'écart observé serait peu probable si le changement n'avait aucun effet réel, au regard d'un seuil choisi avant le test. En pratique, on calcule une p-value : la probabilité d'observer un écart aussi grand que celui mesuré, ou plus, en supposant que le changement ne fait rien. Sous le seuil, souvent 5 %, le résultat est dit significatif. Un intervalle de confiance la complète en indiquant la fourchette des effets plausibles au vu des mesures.
Pourquoi c’est important pour un PM
La significativité protège le PM contre les changements qui n'avaient l'air bons que par hasard, mais elle est souvent mal comprise. Un résultat significatif peut être trop petit pour compter, et un résultat non significatif peut cacher un effet réel que le test n'avait pas la puissance de détecter. Lire l'intervalle, et pas seulement le verdict, conduit à de meilleures décisions.
Exemple
Un test sur une nouvelle page de tarifs montre une hausse de 2 % des inscriptions, avec une p-value de 0,03. Son intervalle de confiance couvre une hausse allant de 0,2 % jusqu'à 3,8 %. Le résultat est significatif, mais l'effet plausible peut être minuscule : l'équipe le met en balance avec le coût d'entretenir deux versions de la page.
Points clés
- Une p-value n'indique pas les chances que la variante l'emporte.
- La puissance statistique est la probabilité de détecter un effet réel d'une taille donnée ; elle dépend de la taille d'échantillon.
- La significativité pratique demande si le gain vaut le coût du changement.
- Consulter les résultats à répétition, ou tester de nombreuses métriques, gonfle les faux positifs si l'on ne corrige pas.
Erreurs fréquentes
- Lire « non significatif » comme « aucun effet ».
- Abaisser le seuil après coup pour obtenir un résultat significatif.
- Présenter une victoire sans la largeur de son intervalle de confiance.
Pour aller plus loin dans Module
Les formations et les leçons qui traitent cette notion :