Probabilités et statistiquesNotion · Glossaire
test de Kolmogorov-Smirnov
Le test de Kolmogorov-Smirnov compare une fonction de répartition empirique à celle d’une loi donnée, ou les fonctions empiriques de deux échantillons, au moyen de leur plus grand écart vertical. Dans sa calibration classique, les observations sont indépendantes, les distributions sont continues et, pour le test à un échantillon, la loi théorique est entièrement spécifiée ; il permet ainsi d’évaluer l’adéquation à une loi ou l’égalité de deux distributions.
Sommaire
Ce que vous allez apprendre
- Distinguer les versions à un échantillon et à deux échantillons.
- Construire une fonction de répartition empirique et calculer la distance maximale.
- Vérifier sur cinq observations que la statistique vaut exactement 0,20.
- Relier la décision à la taille d'échantillon, au seuil et à l'alternative choisie.
- Repérer les adaptations nécessaires avec paramètres estimés, données discrètes ou ex æquo.
En clair
Imaginez cinq mesures rangées de la plus petite à la plus grande. À chaque valeur, on regarde quelle proportion des mesures a déjà été rencontrée. Cette proportion dessine un escalier qui monte de 0 à 1.
Le test de Kolmogorov-Smirnov superpose cet escalier à celui d'un autre échantillon, ou à la courbe d'une loi candidate. Il retient leur plus grand écart vertical. Un écart important fournit un argument contre l'hypothèse que les données suivent la même distribution.
Définition
Le test de Kolmogorov-Smirnov compare des fonctions de répartition, c'est-à-dire les fonctions qui donnent, pour chaque valeur réelle x, la proportion ou la probabilité d'obtenir une valeur inférieure ou égale à x. Pour un échantillon de taille n, sa fonction de répartition empirique, notée Fn, est un escalier dont le saut en un point vaut le nombre d'observations égales à cette valeur, divisé par n.
Dans la version à un échantillon, la fonction Fn est comparée à la fonction de répartition F0 d'une loi entièrement spécifiée. Dans la version à deux échantillons, les fonctions empiriques Fn et Gm, construites avec n et m observations indépendantes, sont comparées entre elles. La statistique D est le plus grand écart absolu sur toutes les valeurs possibles : dans le premier cas, et la même expression avec Gm à la place de F0 dans le second.
Le verdict ne dépend pas de D seul : il faut le rapporter aux tailles d'échantillon, au seuil choisi et à la version unilatérale ou bilatérale du test. Sous les hypothèses classiques d'une loi continue et entièrement spécifiée, la loi nulle de la statistique ne dépend pas de la forme de F0. Cette propriété explique le caractère non paramétrique du test ; elle ne signifie pas que toute donnée, notamment discrète ou avec paramètres estimés, utilise sans adaptation les mêmes valeurs critiques.
Un exemple, pas à pas
Nous confrontons cinq mesures à une loi uniforme sur [0, 10]. Les données sont :
– observations ordonnées : 1, 2, 4, 7 et 9 ;
– effectif : n = 5 ;
– fonction théorique : F0(x) = x/10 entre 0 et 10.
– observations ordonnées : 1, 2, 4, 7 et 9 ;
– effectif : n = 5 ;
– fonction théorique : F0(x) = x/10 entre 0 et 10.
1. Construisons l'escalier empirique. Après les valeurs 1, 2, 4, 7 et 9, F5 vaut respectivement 1/5, 2/5, 3/5, 4/5 et 5/5, soit 0,20 ; 0,40 ; 0,60 ; 0,80 et 1.
2. Comparons les fonctions juste après chaque observation. Les écarts F5 − F0 valent 0,10 ; 0,20 ; 0,20 ; 0,10 et 0,10. Ces écarts doivent être examinés sur tout l'intervalle.
3. Vérifions aussi l'autre côté des sauts. Les écarts F0 − F5 juste avant les observations valent 0,10 ; 0 ; 0 ; 0,10 et 0,10. Aucun ne dépasse 0,20.
4. La distance maximale est D = 0,20. À x = 2, la proportion empirique vaut 2/5 = 0,40 et la loi uniforme donne 2/10 = 0,20 : l'écart est bien 0,20. Une décision exigerait ensuite la valeur critique adaptée à n = 5 et au seuil choisi.
En pratique
Pour contrôler un modèle continu entièrement spécifié, on construit la fonction empirique des mesures puis on calcule son plus grand écart à la fonction théorique. Si les paramètres du modèle ont été estimés sur ces mêmes mesures, une procédure adaptée ou un bootstrap remplace le test classique.
Pour comparer deux groupes indépendants, on superpose leurs deux escaliers empiriques. Le test bilatéral convient si toute différence de distribution compte ; une version unilatérale ne se choisit que si le sens de l'écart a été fixé avant d'observer les données.
Lorsque les écarts dans les queues de distribution sont prioritaires, un test qui leur donne davantage de poids peut être préférable. Le graphique des deux fonctions reste utile pour localiser la zone où l'écart maximal se produit.
Dans un logiciel, il faut vérifier quatre informations avec la p-valeur : test à un ou deux échantillons, alternative choisie, traitement exact ou asymptotique, et présence d'ex æquo. Ces réglages déterminent l'interprétation correcte du résultat.
À ne pas confondre
Test du khi-deux d'adéquation. Il compare des effectifs observés et attendus dans des classes, tandis que Kolmogorov-Smirnov compare des fonctions de répartition sans découpage préalable. Des données catégorielles ou déjà regroupées en classes orientent vers le khi-deux.
Test d'Anderson-Darling. Il mesure aussi l'adéquation d'une distribution, mais accentue les écarts dans les queues. Si une différence près des valeurs extrêmes doit peser davantage qu'une différence centrale de même taille, ce critère les sépare.
Test de Mann-Whitney. Il exploite l'ordre des observations de deux groupes et vise une autre hypothèse. Deux distributions peuvent avoir un rang central comparable mais des dispersions différentes : Kolmogorov-Smirnov peut alors détecter une différence de forme que Mann-Whitney ne cible pas directement.
Limites et pièges
Paramètres estimés sur l'échantillon. Si la moyenne ou un autre paramètre de F0 a été ajusté avec les données testées, les valeurs critiques classiques ne sont plus valables. Il faut employer une correction prévue pour ce cas ou simuler la loi nulle par bootstrap.
Données discrètes et ex æquo. Les sauts possibles ne sont alors plus ceux du cadre continu, et la distribution de D change. Un avertissement du logiciel sur les ex æquo est un symptôme à traiter, pas à ignorer ; une méthode exacte ou une calibration adaptée est nécessaire.
Distance et décision. Dans l'exemple, D = 0,20 décrit un écart observé, mais ne signifie ni 20 % de risque d'erreur ni rejet automatique. La décision exige une p-valeur ou une valeur critique calculée pour la taille d'échantillon et le seuil fixés.
Absence de rejet. Une p-valeur supérieure au seuil ne prouve pas que les distributions sont identiques ; elle indique seulement que l'écart observé ne suffit pas à rejeter l'hypothèse dans ce cadre. Avec cinq observations, de nombreux écarts fins restent difficiles à mettre en évidence.
Pour aller plus loin
La fonction de répartition détaille l'objet comparé par le test et la lecture probabiliste de ses valeurs.
Le test non paramétrique replace Kolmogorov-Smirnov parmi les méthodes qui n'imposent pas une famille paramétrique particulière aux distributions comparées.
Explorez les mathématiques autrement
Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.
Découvrir les offres
