Passer au contenu principal

P-value

La p-value, ou valeur p, est une mesure statistique utilisée dans les tests d'hypothèses. Elle représente la probabilité d'obtenir un résultat au moins aussi extrême que celui observé, sous l'hypothèse nulle. Une p-value inférieure ou égale au seuil de signification α, fixé avant l'observation des données (souvent 5 %), conduit au rejet de l'hypothèse nulle. La p-value ne mesure pas la probabilité que l'hypothèse nulle soit vraie, mais la compatibilité des données avec cette hypothèse.
P-value bilatérale pour neuf faces en dix lancers Onze barres symétriques représentent les nombres de suites possibles. Les quatre barres extrêmes, en rouge, totalisent vingt-deux suites sur mille vingt-quatre. 0–1 face 2 à 8 faces 9–10 faces 22 suites extrêmes sur 1 024 (p ≈ 2,15 %)
Les quatre barres rouges réunissent 22 suites sur 1 024 : les deux extrémités du test bilatéral pour neuf faces observées.
Sommaire

Ce que vous allez apprendre

  • Relier la p-value à la probabilité de données extrêmes sous l’hypothèse nulle.
  • Refaire un calcul binomial bilatéral donnant 22/1 024, soit environ 2,15 %.
  • Comparer la valeur obtenue à un seuil choisi avant les données.
  • Éviter de lire la p-value comme la probabilité que l’hypothèse nulle soit vraie.
  • Distinguer signification statistique, importance pratique et intervalle de confiance.

En clair

Une pièce supposée équilibrée tombe neuf fois sur face en dix lancers. Est-ce une fluctuation plausible, ou un résultat vraiment surprenant ? La p-value répond en regardant ce que produirait le modèle « pièce équilibrée ». Elle additionne les résultats au moins aussi éloignés des cinq faces attendues que les neuf faces observées. Plus cette proportion est petite, moins les données sont compatibles avec le modèle testé. Elle ne donne toutefois pas la probabilité que la pièce soit équilibrée.

Définition

Dans un test d’hypothèse, l’hypothèse nulle, notée H0, fixe le modèle auquel les données sont comparées. Une statistique de test résume ensuite l’écart observé. Si cette statistique, notée S, prend de grandes valeurs lorsque les données s’éloignent de H0, et si Sobs désigne sa valeur observée, la p-value fondée sur cette statistique est p=PH0(SSobs)p = \mathbb{P}_{H_0}(S \geq S_{obs}). Elle est donc calculée en supposant H0 vraie.
Un test bilatéral réunit les résultats au moins aussi incompatibles avec H0 dans les deux directions. Le choix entre test unilatéral et bilatéral doit précéder l’observation des données. Le seuil de signification, noté α, est lui aussi choisi à l’avance, souvent à 5 %. Lorsque pαp \leq \alpha, la règle de décision rejette H0. Lorsque p est supérieur à α, elle ne rejette pas H0, sans pour autant la prouver.
La p-value dépend du modèle nul, de la statistique choisie et du plan d’échantillonnage. Elle mesure la compatibilité des données avec H0, et non la probabilité que H0 soit vraie. Sa petitesse ne mesure pas non plus l’importance pratique de l’écart observé.

Un exemple, pas à pas

On lance dix fois une même pièce. L’hypothèse nulle H0 lui attribue une probabilité de 1/2 de tomber sur face à chaque lancer, les lancers étant indépendants. On observe neuf faces. Le test est bilatéral et son seuil α vaut 5 %.
Étape 1. On note X le nombre de faces. Sous H0, les 210 = 1 024 suites de dix résultats sont équiprobables, et cinq faces constituent le centre de la distribution.
Étape 2. Le côté supérieur comprend neuf ou dix faces. Il contient (109)+(1010)=10+1=11\binom{10}{9} + \binom{10}{10} = 10 + 1 = 11 suites, soit 11/1 024 ≈ 1,07 %.
Étape 3. Par symétrie, le côté inférieur comprend zéro ou une face et contient également 11 suites. La p-value bilatérale vaut donc p=221024=0,021484375p = \frac{22}{1024} = 0{,}021484375, soit environ 2,15 %.
Étape 4. Comme 2,15 % est inférieur au seuil de 5 %, le test rejette l’hypothèse d’une pièce équilibrée. Il ne calcule ni la probabilité que cette hypothèse soit vraie ni l’ampleur du déséquilibre.
Le contrôle est direct : les deux zones extrêmes contiennent chacune 11 suites, donc la probabilité bilatérale doit être exactement le double de 11/1 024 et rester comprise entre 0 et 1.

En pratique

Avant de recueillir les données, on formule l’hypothèse nulle, on choisit la statistique de test, le sens du test et le seuil α. Un test unilatéral convient seulement si une direction précise était fixée avant l’observation ; sinon, le test bilatéral évite d’ignorer l’autre direction.
Après le calcul, on donne la p-value exacte plutôt que la seule mention « significatif ». La comparaison à α fournit une décision pour le test choisi, mais elle doit rester accompagnée de l’écart observé et du contexte de l’étude.
Si la question porte surtout sur la taille plausible d’un effet, une estimation et un intervalle de confiance sont plus informatifs qu’une p-value isolée. Si de nombreuses hypothèses sont testées, une procédure de correction ou un plan d’analyse préalable devient nécessaire.

À ne pas confondre

P-value et seuil de signification. Le seuil α est fixé avant les données ; la p-value est calculée après leur observation. Avec p = 2,15 % et α = 5 %, la décision est de rejeter H0.
Signification statistique et importance pratique. La première compare p à α ; la seconde porte sur la taille et les conséquences de l’effet. Un résultat peut franchir 5 % tout en correspondant à un écart trop faible pour être utile.
P-value et intervalle de confiance. La p-value teste une hypothèse nulle déterminée. L’intervalle de confiance présente une plage d’estimations compatibles avec les données selon une procédure donnée ; il renseigne donc aussi sur la précision.

Limites et pièges

Inversion de probabilité. Une p-value de 2,15 % signifie que les données aussi extrêmes ont une probabilité de 2,15 % sous H0. Elle ne signifie pas que H0 a 2,15 % de chances d’être vraie. Il faut conserver le sens du conditionnement.
Effet de falaise au seuil. Des p-values de 4,9 % et 5,1 % sont très proches, même si la règle à α = 5 % produit deux décisions différentes. Il faut publier la valeur exacte et éviter d’en faire deux degrés de preuve radicalement opposés.
Choix guidés par les données. Multiplier les tests, ne garder que le plus favorable ou arrêter la collecte dès que p passe sous 5 % fausse le risque prévu par la procédure. Il faut annoncer le plan d’analyse et corriger les comparaisons multiples.
Taille et nature de l’échantillon. Un grand échantillon peut rendre détectable un écart minuscule ; un petit peut manquer un écart réel. Dans un test discret, comme les dix lancers, seules certaines p-values sont possibles. Il faut examiner l’estimation, la précision et le modèle du test.

Pour aller plus loin

Test d'hypothèse — Replacer la p-value dans la procédure complète, de l’hypothèse nulle à la règle de décision.
intervalle de confiance — Passer d’une décision de test à une plage d’estimations qui rend la précision visible.
Tester sans se tromper — Approfondir les précautions qui encadrent l’usage des tests statistiques.
Continuez avec Tangente

Explorez les mathématiques autrement

Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.

Découvrir les offres