Passer au contenu principal

Test d'hypothèse

Un test d'hypothèse aide à décider si des données sont compatibles avec une idée de départ. Cette idée est l'hypothèse nulle, notée H0 ; l'hypothèse alternative, notée H1, décrit l'écart recherché. À partir d'un échantillon, le test conduit soit à rejeter H0, soit à ne pas la rejeter, sans jamais apporter de certitude.
Régions du test binomial bilatéral Pour 100 lancers, le test rejette l'hypothèse nulle de 0 à 39 piles et de 61 à 100 piles. Le résultat observé de 62 piles est dans la région de rejet. rejet de H₀ non-rejet de H₀ rejet de H₀ 0 39 40 60 61 100 62 observé nombre de piles sur 100 lancers
Pour 100 lancers, 62 piles se situe dans la région de rejet bilatérale, qui commence à 61 piles.
Sommaire

Ce que vous allez apprendre

  • Distinguer H0 de H1 et comprendre le rôle du seuil de signification.
  • Interpréter correctement une valeur p, un rejet et une absence de rejet.
  • Refaire un test binomial bilatéral sur 100 lancers.
  • Repérer les risques de première et de deuxième espèce ainsi que les pièges de tests multiples.

En clair

Une pièce est lancée 100 fois et donne 62 piles. Cet écart à 50 peut venir du hasard, même si la pièce est équilibrée. Un test d'hypothèse mesure si le résultat observé serait assez rare sous cette supposition pour conduire à l'écarter.
Le verdict n'est jamais une certitude. Un seuil choisi à l'avance limite le risque de rejeter à tort l'hypothèse de départ, sans supprimer le risque inverse de conserver une hypothèse fausse.

Définition

Un test d'hypothèse confronte des données issues d'un échantillon à deux propositions sur la population. L'hypothèse nulle, notée H0, décrit la situation prise comme référence. L'hypothèse alternative, notée H1, décrit l'écart recherché. Une statistique de test résume les données et sa loi sous H0 détermine une région de rejet.
Le seuil de signification, noté α, est fixé avant l'observation. Lorsque H0 est composite, le risque de première espèce est le supremum, parmi toutes les valeurs satisfaisant H0, de la probabilité de la rejeter. Un test de niveau α maintient ce risque au plus égal à α ; l'égalité n'est atteinte que dans certains cas. La valeur p est la probabilité, calculée sous H0, d'obtenir un résultat au moins aussi défavorable à H0 que celui observé. Lorsque la valeur p est inférieure ou égale à α, H0 est rejetée. Sinon, elle n'est pas rejetée ; cela ne prouve pas qu'elle est vraie.
Le risque de deuxième espèce, noté β, est la probabilité de ne pas rejeter H0 lorsqu'une alternative donnée est vraie. La puissance du test vaut 1β1-\beta pour cette alternative. Un test bilatéral recherche un écart dans les deux sens ; un test unilatéral ne vise qu'un sens, qui doit être choisi avant de regarder les données.

Un exemple, pas à pas

On teste l'équilibre d'une pièce avec un test binomial exact bilatéral. Les données sont 100 lancers indépendants, 62 piles et 38 faces. Sous H0, la probabilité d'obtenir pile vaut 0,5 ; sous H1, elle diffère de 0,5. Le seuil α vaut 5 %.
1. La statistique observée est le nombre de piles : 62.
2. Sous H0, ce nombre suit une loi binomiale de paramètres 100 et 0,5.
3. Avec la convention bilatérale à queues égales retenue ici, la valeur p est, par symétrie, le double de la probabilité d'obtenir au moins 62 piles :
p=2k=62100(100k)(0,5)k(0,5)100k0,02098p=2\sum_{k=62}^{100}\binom{100}{k}(0{,}5)^k(0{,}5)^{100-k}\approx0{,}02098
4. Comme 0,02098 est inférieur à 0,05, H0 est rejetée au seuil de 5 %.
Le contrôle se refait avec les seuils entiers du même test : la région de rejet est de 0 à 39 piles ou de 61 à 100 piles. Sous H0, sa probabilité totale vaut environ 3,52 %, donc elle ne dépasse pas 5 %. Le résultat 62 appartient bien à cette région.

En pratique

Pour contrôler une proportion, on compare le nombre de succès observés à ceux qu'annonce une proportion de référence. Un test binomial exact convient lorsque chaque essai a deux issues, une même probabilité de succès et que les essais sont indépendants.
Pour comparer une moyenne à une valeur de référence, le choix dépend notamment de la distribution des données et de ce que l'on sait de leur dispersion. Si les hypothèses d'un test paramétrique ne sont pas défendables, un test non paramétrique adapté peut être préférable.
Avant tout calcul, on fixe H0, H1, le caractère unilatéral ou bilatéral et le seuil α. Après le calcul, on rapporte la statistique, la valeur p, le seuil et le contexte ; le seul mot « significatif » ne décrit ni l'importance ni l'utilité de l'écart.

À ne pas confondre

Test d'hypothèse et intervalle de confiance. Le test rend une décision pour une hypothèse et un seuil donnés ; l'intervalle fournit un ensemble de valeurs compatibles avec les données à un niveau de confiance donné. Pour une valeur candidate, cette correspondance vaut lorsque l'intervalle est obtenu par inversion du test bilatéral correspondant, au même niveau et avec la même règle bilatérale.
Signification statistique et importance pratique. Une petite valeur p indique une incompatibilité avec H0 dans le modèle choisi. Elle ne mesure pas la taille de l'effet. Avec un très grand échantillon, un écart minuscule peut être statistiquement significatif sans conséquence pratique notable.
Ne pas rejeter et accepter. Ne pas rejeter H0 signifie que le test n'a pas fourni assez d'éléments contre elle au seuil choisi. Un petit échantillon peut produire ce verdict même lorsque H0 est fausse, faute de puissance.

Limites et pièges

Seuil choisi après observation. Modifier α ou décider après coup qu'un test devait être unilatéral augmente le risque de conclusion opportuniste. Le seuil et le sens du test doivent être arrêtés avant d'examiner le résultat.
Seuil discret. Dans l'exemple des 100 lancers, aucune frontière entière ne donne exactement 5 % pour le test bilatéral symétrique. Rejeter à 39 piles ou moins, ou à 61 piles ou plus, produit un risque de première espèce d'environ 3,52 % : le test est conservateur.
Hypothèses du modèle violées. Si les lancers dépendent les uns des autres ou si la probabilité de pile varie, la loi binomiale utilisée dans l'exemple n'est plus justifiée. Il faut alors modéliser cette dépendance ou cette variation avant de tester.
Multiplication des tests. Réaliser de nombreux tests au seuil de 5 % accroît la probabilité d'au moins un rejet erroné dans l'ensemble. Il faut annoncer la famille de tests et employer une correction ou une méthode globale adaptée.

Pour aller plus loin

L'intervalle de confiance montre quelles valeurs du paramètre restent compatibles avec les données dans un cadre donné.
L'article Tester sans se tromper prolonge la réflexion sur la construction et l'interprétation prudente des tests statistiques.
Continuez avec Tangente

Explorez les mathématiques autrement

Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.

Découvrir les offres