Probabilités et statistiquesNotion · Glossaire
test non paramétrique
Les tests non paramétriques sont des procédures statistiques qui évitent généralement de spécifier une famille paramétrique complète pour la distribution des données. Ils reposent néanmoins sur des hypothèses propres à chaque procédure et peuvent utiliser les rangs, les signes, les fonctions de répartition ou d'autres statistiques adaptées à la question étudiée.
Sommaire
Ce que vous allez apprendre
- Distinguer l'absence de famille paramétrique de l'absence d'hypothèses.
- Refaire un calcul exact de Mann–Whitney sur huit observations.
- Choisir une procédure selon l'indépendance, l'appariement et la question testée.
- Interpréter une valeur p proche du seuil sans conclure à une égalité prouvée.
En clair
Deux groupes ont obtenu les valeurs 12, 15, 18, 22 et 20, 24, 27, 30. Pour savoir si leurs résultats diffèrent, on peut classer ensemble les huit valeurs. Le premier groupe occupe surtout les petits rangs, sans qu'il soit nécessaire de supposer une courbe en cloche.
Un test non paramétrique exploite ainsi l'ordre des observations, leurs signes ou d'autres caractéristiques peu dépendantes d'une forme de distribution choisie à l'avance. Il reste néanmoins fondé sur des hypothèses, notamment sur la manière dont les données ont été recueillies.
Définition
Un test non paramétrique est une procédure d'inférence dont le modèle n'est pas réduit à une famille de distributions décrite par quelques paramètres, comme la moyenne et la variance d'une loi normale. Selon le test, il peut servir à comparer deux groupes, étudier des données appariées, rechercher une association ou mesurer l'écart entre une distribution observée et une distribution de référence.
Beaucoup de ces procédures remplacent les valeurs par leurs rangs. Une transformation strictement croissante change alors les valeurs, mais pas leur ordre. D'autres utilisent les signes des différences ou la fonction de répartition empirique. L'adjectif « non paramétrique » ne signifie donc ni « sans calcul » ni « sans hypothèse ». L'indépendance des observations, le plan d'échantillonnage, le caractère ordinal des données ou le traitement des ex æquo restent à contrôler selon la procédure.
La conclusion dépend aussi de la question posée. Par exemple, le test de Mann–Whitney compare la position relative de deux distributions indépendantes. L'interpréter uniquement comme un test des médianes demande des conditions supplémentaires, notamment des formes comparables si l'on veut isoler un simple décalage de position.
Un exemple, pas à pas
On compare deux groupes indépendants par le test de Mann–Whitney. A contient 12, 15, 18 et 22 ; B contient 20, 24, 27 et 30. Les valeurs sont distinctes : aucun rang moyen n'est nécessaire.
1. Classement commun : 12A, 15A, 18A, 20B, 22A, 24B, 27B, 30B. Les rangs vont de 1 à 8.
2. La somme des rangs de A, notée RA, vaut 1 + 2 + 3 + 5 = 11.
3. Le nombre d'observations de A, noté nA, vaut 4 et . Pour B, UB = 4 × 4 − 1 = 15 ; on retient U = 1.
4. Sous l'hypothèse nulle, les étiquettes A et B sont échangeables. Il existe 70 répartitions de quatre rangs parmi huit. Parmi elles, 5 donnent U ≤ 1 et, par symétrie, 5 donnent U ≥ 15. Selon la convention bilatérale usuelle, cela fait 10 répartitions au moins aussi extrêmes dans les deux queues, d'où p = 10/70 ≈ 0,143.
Au seuil de 5 %, on ne rejette pas l'hypothèse nulle, car 0,143 > 0,05. Contrôle : tous les rangs totalisent 36, donc ceux de B totalisent 36 − 11 = 25.
En pratique
Pour comparer deux groupes indépendants mesurés sur une échelle ordinale, le test de Mann–Whitney offre une procédure fondée sur les rangs lorsque la question porte sur la position relative des distributions. Il ne remplace pas de manière générale un test t visant une différence de moyennes. Le geste décisif consiste à vérifier l'indépendance, puis à classer ensemble les observations.
Avec des mesures prises avant et après sur les mêmes individus, les observations ne sont plus indépendantes par paires. Le test des rangs signés de Wilcoxon est alors une alternative ; on travaille sur les différences appariées plutôt que sur deux listes séparées.
Pour confronter une distribution observée à une loi entièrement spécifiée, le test de Kolmogorov–Smirnov examine le plus grand écart entre fonctions de répartition. Il ne se choisit pas seulement parce qu'un histogramme paraît irrégulier : la question testée et la façon dont les paramètres de référence ont été obtenus comptent.
À ne pas confondre
Un test paramétrique formule un modèle à l'aide d'un nombre fini de paramètres. Si la question porte précisément sur une moyenne et que ses conditions sont raisonnables, un test t répond directement à cette question ; le test de Mann–Whitney répond à une autre formulation fondée sur l'ordre relatif.
Une méthode robuste résiste à certains écarts au modèle ou à certaines valeurs atypiques. Elle n'est pas nécessairement non paramétrique : une procédure peut conserver un modèle paramétrique tout en limitant l'influence des observations extrêmes.
Un test sans distribution possède, sous des conditions précisées, une loi nulle qui ne dépend pas de la distribution continue commune. Cette propriété plus étroite ne s'applique pas automatiquement à toute procédure qualifiée de non paramétrique.
Limites et pièges
Des rangs ex æquo modifient le calcul. Si deux observations ont la même valeur, leur attribuer arbitrairement deux rangs successifs fausse la statistique. Il faut employer leurs rangs moyens et la correction prévue par le test pour déterminer la probabilité.
Une dépendance ignorée invalide le plan. Des mesures avant et après sur les mêmes personnes ressemblent à deux groupes, mais elles sont appariées. Il faut conserver les paires et choisir une procédure appariée, telle que le test des rangs signés.
Une petite valeur p ne mesure pas l'importance de l'écart. Elle renseigne sur la compatibilité des données avec l'hypothèse nulle dans le modèle retenu. Il faut aussi rapporter un effet adapté à la question et décrire les distributions observées.
Le seuil de 5 % n'est pas une frontière naturelle. Dans l'exemple, p ≈ 0,143 conduit à ne pas rejeter aux seuils de 0,05 et de 0,10, mais à rejeter au seuil de 0,15 si celui-ci avait été fixé avant l'analyse. Il faut annoncer le seuil et éviter de traduire « non rejet » par « égalité prouvée ».
Pour aller plus loin
Le Test d'hypothèse replace la valeur p, le seuil et la décision dans le cadre général de l'inférence statistique.
Le test de Kolmogorov-Smirnov approfondit une procédure non paramétrique fondée sur l'écart entre fonctions de répartition.
Explorez les mathématiques autrement
Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.
Découvrir les offres
