Passer au contenu principal
Tangente

Erreur de première espèce

En statistique inférentielle, l'erreur de première espèce (ou erreur de type I) est l'erreur consistant à rejeter l'hypothèse nulle alors qu'elle est vraie. Sa probabilité est notée alpha et est appelée niveau de signification ou risque de première espèce du test. Le statisticien choisit alpha avant d'effectuer le test, typiquement à 5% ou 1%. La région critique du test est définie pour contrôler cette probabilité. L'erreur de première espèce correspond à une fausse alarme.
Région critique d'un test sur vingt lancers Les vingt et une barres de la loi binomiale sont symétriques autour de dix faces. Les six barres rouges de quinze à vingt faces forment une région critique de probabilité voisine de 2,07 pour cent. 20 lancers d'une pièce équilibrée Hauteur des barres proportionnelle à P(X = k) région critique : X ≥ 15 0 5 10 15 20 X : nombre de faces α = 21 700 / 1 048 576 ≈ 2,07 %
Sous l'hypothèse d'une pièce équilibrée, les six barres rouges forment la région X ≥ 15 et totalisent environ 2,07 %.
Sommaire

Ce que vous allez apprendre

  • Interpréter l'erreur de première espèce comme un rejet à tort de l'hypothèse nulle.
  • Relier le niveau alpha à la probabilité de la région critique sous l'hypothèse nulle.
  • Calculer un risque effectif d'environ 2,07 % pour une règle portant sur 20 lancers.
  • Distinguer niveau alpha, valeur p et erreur de deuxième espèce.
  • Repérer les effets des tests multiples et d'une règle choisie après observation.

En clair

Une pièce équilibrée est lancée 20 fois. Une règle décide qu'elle est déséquilibrée si elle donne au moins 15 faces. Pourtant, même une pièce parfaitement équilibrée peut produire par hasard 15 faces ou davantage. La règle déclenche alors une fausse alarme.
Cette fausse alarme est une erreur de première espèce. Le seuil choisi avant les lancers limite sa fréquence à long terme lorsque l'hypothèse testée est vraie ; il ne garantit pas qu'aucune erreur ne surviendra.

Définition

Dans un test statistique, l'hypothèse nulle, notée H0, décrit la situation tenue pour référence. Une erreur de première espèce, ou erreur de type I, se produit lorsque la règle du test rejette H0 alors que H0 est vraie. Si la lettre grecque alpha, notée α, désigne le risque de première espèce, alors : α=Pr(rejeter H0H0 vraie)\alpha=\Pr(\text{rejeter }H_0\mid H_0\text{ vraie}). Cette probabilité est conditionnelle à la vérité de H0 ; elle n'est pas la probabilité que H0 soit vraie après observation des données.
Le niveau de signification est fixé avant l'examen des résultats, souvent à 5 % ou 1 %. La région critique rassemble les résultats qui entraînent le rejet. Elle est choisie pour que, sous H0, leur probabilité soit égale à α ou ne dépasse pas α. Dans un modèle discret, l'égalité exacte peut être impossible : le risque effectif est alors inférieur au niveau nominal.
Pour une hypothèse nulle composée de plusieurs lois possibles, contrôler le niveau signifie que la probabilité de rejet ne dépasse α pour aucune loi de H0. Diminuer α rend la fausse alarme moins probable, mais peut augmenter le risque de ne pas détecter un écart réel si le reste du protocole ne change pas.

Un exemple, pas à pas

On teste une pièce au moyen de 20 lancers indépendants. Sous l'hypothèse nulle H0, la pièce est équilibrée et chaque lancer donne face avec la probabilité 1/2. La variable X compte les faces. La règle rejette H0 lorsque X est au moins égal à 15.
1. La région critique contient les six valeurs 15, 16, 17, 18, 19 et 20.
2. Sous H0, X suit la loi binomiale de paramètres 20 et 1/2. Le risque effectif vaut : Pr(X15H0)=k=1520(20k)(12)20\Pr(X\geq15\mid H_0)=\sum_{k=15}^{20}\binom{20}{k}\left(\frac12\right)^{20}.
3. Les coefficients correspondants sont 15 504, 4 845, 1 140, 190, 20 et 1. Leur somme vaut 21 700, tandis que 220 vaut 1 048 576.
4. Ainsi, α = 21 700 / 1 048 576 ≈ 0,0207, soit environ 2,07 %. La figure montre la petite masse de probabilité placée dans la région critique.
5. Le contrôle refaisable consiste à additionner les six coefficients : 15 504 + 4 845 + 1 140 + 190 + 20 + 1 = 21 700. Le test respecte donc un niveau nominal de 5 %, puisque 2,07 % est inférieur à 5 %, mais son risque effectif n'est pas exactement 5 %.

En pratique

Lors d'un contrôle de fabrication, rejeter H0 revient par exemple à signaler un procédé pourtant conforme. Si une fausse alerte entraîne un arrêt coûteux, un niveau plus faible peut être préféré, à condition d'examiner aussi la capacité à détecter un défaut réel.
Dans un essai comparatif, le niveau α encadre le risque d'annoncer un effet lorsque le modèle nul retenu est vrai. Le protocole fixe ce niveau avant les données ; le choisir après avoir vu les résultats ne contrôle plus le risque annoncé.
Dans un test sur une pièce, la région X ≥ 15 est adaptée à la recherche d'un excès de faces. Si un déficit de faces compte aussi, il faut une règle bilatérale qui répartit le risque entre les deux extrémités, et non réutiliser la même région critique.

À ne pas confondre

Erreur de première et de deuxième espèce. La première rejette H0 quand elle est vraie ; la deuxième ne rejette pas H0 alors qu'une situation alternative est vraie. Déclarer déséquilibrée une pièce équilibrée relève du type I ; ne pas repérer une pièce réellement déséquilibrée relève du type II.
Niveau α et valeur p. Le niveau α est fixé avant les données et règle la fréquence de fausses alertes sous H0. La valeur p est calculée à partir du résultat observé. On rejette lorsque la valeur p satisfait le critère prévu, souvent p ≤ α ; ni l'une ni l'autre n'est la probabilité que H0 soit vraie.

Limites et pièges

Niveau nominal et risque effectif. Avec 20 lancers et la région X ≥ 15, le risque vaut environ 2,07 %, et non 5 %. Les valeurs possibles étant discrètes, un seuil de 5 % peut seulement imposer une borne ; il faut calculer la probabilité réelle de la région critique.
Tests multiples. Si vingt tests de niveau 5 % sont menés, chaque test peut respecter sa règle sans que le risque d'au moins une fausse alerte dans l'ensemble reste à 5 %. Il faut définir la famille de tests et appliquer une procédure qui contrôle le risque global recherché.
Choix après observation. Déplacer la frontière de rejet après avoir vu X, ou essayer plusieurs analyses et ne garder que celle qui rejette, invalide le niveau annoncé. La règle, le sens du test et les traitements de données doivent être fixés avant l'observation ou intégrés au calcul du risque.
Interprétation conditionnelle. Un niveau de 5 % ne signifie ni qu'un résultat rejeté a 5 % de chances d'être une erreur, ni que H0 a 5 % de chances d'être vraie. Le niveau décrit les répétitions du test sous H0 ; une probabilité sur les hypothèses exige un autre cadre et d'autres informations.

Pour aller plus loin

Erreur de deuxième espèce — Relier la fausse alarme au risque opposé : laisser passer un écart réel sans rejeter l'hypothèse nulle.
Tester sans se tromper — Replacer les deux types d'erreurs dans la logique complète d'une décision statistique.
Continuez avec Tangente

Explorez les mathématiques autrement

Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.

Découvrir les offres