Probabilités et statistiquesNotion · Glossaire
Test d'hypothèse
Un test d'hypothèse aide à décider si des données sont compatibles avec une idée de départ. Cette idée est l'hypothèse nulle, notée H0 ; l'hypothèse alternative, notée H1, décrit l'écart recherché. À partir d'un échantillon, le test conduit soit à rejeter H0, soit à ne pas la rejeter, sans jamais apporter de certitude.
Sommaire
Ce que vous allez apprendre
- Distinguer H0 de H1 et comprendre le rôle du seuil de signification.
- Interpréter correctement une valeur p, un rejet et une absence de rejet.
- Refaire un test binomial bilatéral sur 100 lancers.
- Repérer les risques de première et de deuxième espèce ainsi que les pièges de tests multiples.
En clair
Une pièce est lancée 100 fois et donne 62 piles. Cet écart à 50 peut venir du hasard, même si la pièce est équilibrée. Un test d'hypothèse mesure si le résultat observé serait assez rare sous cette supposition pour conduire à l'écarter.
Le verdict n'est jamais une certitude. Un seuil choisi à l'avance limite le risque de rejeter à tort l'hypothèse de départ, sans supprimer le risque inverse de conserver une hypothèse fausse.
Définition
Un test d'hypothèse confronte des données issues d'un échantillon à deux propositions sur la population. L'hypothèse nulle, notée H0, décrit la situation prise comme référence. L'hypothèse alternative, notée H1, décrit l'écart recherché. Une statistique de test résume les données et sa loi sous H0 détermine une région de rejet.
Le seuil de signification, noté α, est fixé avant l'observation. Lorsque H0 est composite, le risque de première espèce est le supremum, parmi toutes les valeurs satisfaisant H0, de la probabilité de la rejeter. Un test de niveau α maintient ce risque au plus égal à α ; l'égalité n'est atteinte que dans certains cas. La valeur p est la probabilité, calculée sous H0, d'obtenir un résultat au moins aussi défavorable à H0 que celui observé. Lorsque la valeur p est inférieure ou égale à α, H0 est rejetée. Sinon, elle n'est pas rejetée ; cela ne prouve pas qu'elle est vraie.
Le risque de deuxième espèce, noté β, est la probabilité de ne pas rejeter H0 lorsqu'une alternative donnée est vraie. La puissance du test vaut pour cette alternative. Un test bilatéral recherche un écart dans les deux sens ; un test unilatéral ne vise qu'un sens, qui doit être choisi avant de regarder les données.
Un exemple, pas à pas
On teste l'équilibre d'une pièce avec un test binomial exact bilatéral. Les données sont 100 lancers indépendants, 62 piles et 38 faces. Sous H0, la probabilité d'obtenir pile vaut 0,5 ; sous H1, elle diffère de 0,5. Le seuil α vaut 5 %.
1. La statistique observée est le nombre de piles : 62.
2. Sous H0, ce nombre suit une loi binomiale de paramètres 100 et 0,5.
3. Avec la convention bilatérale à queues égales retenue ici, la valeur p est, par symétrie, le double de la probabilité d'obtenir au moins 62 piles :
2. Sous H0, ce nombre suit une loi binomiale de paramètres 100 et 0,5.
3. Avec la convention bilatérale à queues égales retenue ici, la valeur p est, par symétrie, le double de la probabilité d'obtenir au moins 62 piles :
4. Comme 0,02098 est inférieur à 0,05, H0 est rejetée au seuil de 5 %.
Le contrôle se refait avec les seuils entiers du même test : la région de rejet est de 0 à 39 piles ou de 61 à 100 piles. Sous H0, sa probabilité totale vaut environ 3,52 %, donc elle ne dépasse pas 5 %. Le résultat 62 appartient bien à cette région.
En pratique
Pour contrôler une proportion, on compare le nombre de succès observés à ceux qu'annonce une proportion de référence. Un test binomial exact convient lorsque chaque essai a deux issues, une même probabilité de succès et que les essais sont indépendants.
Pour comparer une moyenne à une valeur de référence, le choix dépend notamment de la distribution des données et de ce que l'on sait de leur dispersion. Si les hypothèses d'un test paramétrique ne sont pas défendables, un test non paramétrique adapté peut être préférable.
Avant tout calcul, on fixe H0, H1, le caractère unilatéral ou bilatéral et le seuil α. Après le calcul, on rapporte la statistique, la valeur p, le seuil et le contexte ; le seul mot « significatif » ne décrit ni l'importance ni l'utilité de l'écart.
À ne pas confondre
Test d'hypothèse et intervalle de confiance. Le test rend une décision pour une hypothèse et un seuil donnés ; l'intervalle fournit un ensemble de valeurs compatibles avec les données à un niveau de confiance donné. Pour une valeur candidate, cette correspondance vaut lorsque l'intervalle est obtenu par inversion du test bilatéral correspondant, au même niveau et avec la même règle bilatérale.
Signification statistique et importance pratique. Une petite valeur p indique une incompatibilité avec H0 dans le modèle choisi. Elle ne mesure pas la taille de l'effet. Avec un très grand échantillon, un écart minuscule peut être statistiquement significatif sans conséquence pratique notable.
Ne pas rejeter et accepter. Ne pas rejeter H0 signifie que le test n'a pas fourni assez d'éléments contre elle au seuil choisi. Un petit échantillon peut produire ce verdict même lorsque H0 est fausse, faute de puissance.
Limites et pièges
Seuil choisi après observation. Modifier α ou décider après coup qu'un test devait être unilatéral augmente le risque de conclusion opportuniste. Le seuil et le sens du test doivent être arrêtés avant d'examiner le résultat.
Seuil discret. Dans l'exemple des 100 lancers, aucune frontière entière ne donne exactement 5 % pour le test bilatéral symétrique. Rejeter à 39 piles ou moins, ou à 61 piles ou plus, produit un risque de première espèce d'environ 3,52 % : le test est conservateur.
Hypothèses du modèle violées. Si les lancers dépendent les uns des autres ou si la probabilité de pile varie, la loi binomiale utilisée dans l'exemple n'est plus justifiée. Il faut alors modéliser cette dépendance ou cette variation avant de tester.
Multiplication des tests. Réaliser de nombreux tests au seuil de 5 % accroît la probabilité d'au moins un rejet erroné dans l'ensemble. Il faut annoncer la famille de tests et employer une correction ou une méthode globale adaptée.
Pour aller plus loin
L'intervalle de confiance montre quelles valeurs du paramètre restent compatibles avec les données dans un cadre donné.
L'article Tester sans se tromper prolonge la réflexion sur la construction et l'interprétation prudente des tests statistiques.
Explorez les mathématiques autrement
Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.
Découvrir les offres
