Passer au contenu principal
Probabilités et statistiquesMéthode · Glossaire

méthode de jackknife

En statistique, la méthode du jackknife estime le biais et la variance d’un estimateur à partir d’un échantillon d’observations indépendantes et de même loi. Elle recalcule l’estimateur sur chacun des sous-échantillons obtenus en retirant, à tour de rôle, une seule observation. Pour une statistique suffisamment régulière, les écarts entre ces résultats mesurent sa sensibilité aux données et permettent d’en corriger approximativement le biais.
Retraits successifs du jackknife Les valeurs 2, 4, 6 et 8 sont retirées chacune à leur tour. Les variances partielles sont 8 sur 3, 56 sur 9, 56 sur 9 et 8 sur 3. Échantillon complet 2468 Retrait de 2 2 468 Var = 8/3 Retrait de 4 24 68 Var = 56/9 Retrait de 6 246 8 Var = 56/9 Retrait de 8 2468 Var = 8/3 Moyenne = 40/9
Chaque observation est retirée une fois ; les quatre variances partielles valent 8/3, 56/9, 56/9 et 8/3.
Sommaire

Ce que vous allez apprendre

  • Identifier le mécanisme de retrait une observation à la fois.
  • Calculer la correction du biais et la variance jackknife.
  • Distinguer le jackknife du bootstrap et de la validation croisée.
  • Reconnaître les limites liées aux statistiques non lisses et aux données dépendantes.

En clair

Prenons quatre mesures : 2, 4, 6 et 8. On recalcule la même statistique quatre fois, en laissant de côté successivement chacune des mesures. Si les quatre résultats changent beaucoup, la statistique dépend fortement des observations individuelles ; s’ils restent proches, elle paraît plus stable.
Le jackknife organise ce retrait « une observation à la fois ». La moyenne des résultats obtenus sert à évaluer le biais de l’estimation initiale, tandis que leur dispersion fournit une estimation de sa variance.

Définition

La méthode de jackknife est un procédé déterministe de rééchantillonnage appliqué à un échantillon de n observations. On calcule d’abord l’estimateur recherché sur l’échantillon complet. Puis on forme exactement n sous-échantillons de taille n − 1 : le sous-échantillon numéro i omet seulement l’observation numéro i. La même règle de calcul doit être définie sur chacun d’eux. Notons θ^\hat{\theta} l’estimation complète, θ^(i)\hat{\theta}_{(-i)} celle obtenue sans l’observation i, et θˉ()\bar{\theta}_{(-\cdot)} la moyenne des n estimations partielles. L’estimation jackknife du biais et l’estimation corrigée sont :
biais^J=(n1)(θˉ()θ^),θ^J=nθ^(n1)θˉ()\widehat{\operatorname{biais}}_{J}=(n-1)\left(\bar{\theta}_{(-\cdot)}-\hat{\theta}\right),\qquad \hat{\theta}_{J}=n\hat{\theta}-(n-1)\bar{\theta}_{(-\cdot)}
Cette correction vise surtout le terme de biais dominant des statistiques assez régulières. Elle n’assure pas une amélioration universelle, notamment pour une statistique non lisse ou très sensible à quelques observations.

Le principe

Avec n observations, calculez d’abord l’estimation complète. Retirez ensuite l’observation i, recalculez exactement la même statistique et répétez l’opération pour les indices de 1 à n. Faites la moyenne des n estimations partielles. La variance jackknife estimée de l’estimateur est alors :
Var^J(θ^)=n1ni=1n(θ^(i)θˉ())2\widehat{\operatorname{Var}}_{J}(\hat{\theta})=\frac{n-1}{n}\sum_{i=1}^{n}\left(\hat{\theta}_{(-i)}-\bar{\theta}_{(-\cdot)}\right)^2
Le calcul s’arrête lorsque chacune des observations a été omise une fois et une seule.

Quand l'utiliser

Le jackknife s’applique à un échantillon fini lorsque la statistique étudiée peut être recalculée après chaque retrait. Les observations sont habituellement supposées indépendantes et de même loi ; une dépendance temporelle ou spatiale exige une variante par blocs. La règle de calcul et ses conventions doivent rester identiques pour l’échantillon complet et les n sous-échantillons.
La méthode est surtout fiable pour une statistique suffisamment régulière, dont une petite modification des données entraîne une petite modification du résultat. Pour la médiane de l’échantillon 1, 2, 3, retirer une valeur produit 1,5, 2 ou 2,5 : ce comportement discret ne satisfait pas les approximations usuelles du jackknife. Un bootstrap adapté constitue alors souvent une meilleure piste.

Un exemple, pas à pas

On observe les valeurs 2, 4, 6 et 8. L’estimateur choisi est la variance empirique calculée avec le diviseur n. Il vaut 5 sur les quatre données. Chaque donnée va être retirée une fois ; la figure synthétise ces quatre sous-échantillons et leurs résultats.
1. Sans 2, puis sans 8, la variance avec le diviseur 3 vaut 8/3.
2. Sans 4, puis sans 6, elle vaut 56/9.
3. La moyenne des quatre estimations est θˉ()=40/9\bar{\theta}_{(-\cdot)}=40/9.
4. Le biais estimé vaut 3(40/95)=5/33(40/9-5)=-5/3.
5. L’estimation corrigée vaut donc θ^J=5(5/3)=20/3\hat{\theta}_{J}=5-(-5/3)=20/3.
Pour contrôler, la somme des carrés des écarts à la moyenne 5 est 20 ; la variance usuelle avec le diviseur n − 1 vaut bien 20/3. La dispersion des quatre estimations partielles donne aussi Var^J(θ^)=256/279,481\widehat{\operatorname{Var}}_{J}(\hat{\theta})=256/27\approx9{,}481.

En pratique

Pour une moyenne, un coefficient de régression ou une statistique calculée par un logiciel, le jackknife fournit une estimation rapide de l’erreur sans choisir de tirages aléatoires. Il suffit d’automatiser les n retraits et de conserver tous les résultats.
Les estimations partielles servent aussi de diagnostic d’influence. Une valeur très éloignée des autres signale qu’une observation particulière modifie fortement le résultat ; il faut alors examiner cette observation et le modèle, pas la supprimer automatiquement.
Lorsque la statistique présente des ruptures, des seuils ou une forte asymétrie, on préfère souvent le bootstrap. Pour des données dépendantes, on retire des blocs cohérents plutôt que des observations isolées.

À ne pas confondre

Avec le bootstrap. Le jackknife produit exactement n échantillons en retirant chaque observation une fois. Le bootstrap effectue de nombreux tirages aléatoires avec remise, généralement de taille n. Avec quatre données, le jackknife donne donc quatre retraits déterminés, tandis qu’une analyse bootstrap peut générer des centaines ou des milliers de tirages.
Avec la validation croisée. La validation croisée retire des données pour mesurer la performance prédictive d’un modèle sur les données écartées. Le jackknife recalcule un estimateur afin d’en évaluer le biais, la variance ou l’influence. Retirer une observation sans calculer d’erreur de prédiction relève ici du jackknife, pas d’une validation.

Limites et pièges

Très petit échantillon. Avec n = 1, le retrait laisse un échantillon vide et la plupart des statistiques deviennent indéfinies. Avec quelques observations seulement, l’approximation peut rester instable ; il faut signaler cette fragilité plutôt que surinterpréter la variance calculée.
Statistique non lisse. Une médiane, un quantile, un maximum ou une règle à seuil peut changer par sauts. Des estimations partielles identiques ou brusquement dispersées avertissent que la correction de biais et la variance jackknife peuvent être peu précises ; un bootstrap adapté est à envisager.
Données dépendantes. Retirer une observation isolée d’une série chronologique rompt la structure de dépendance. Il faut employer un jackknife par blocs, dont la taille respecte cette structure, ou une autre méthode de rééchantillonnage conçue pour les données dépendantes.
Correction non garantie. Soustraire le biais estimé ne prouve pas que l’erreur totale diminue. Une correction très grande par rapport à l’estimation initiale constitue un signal d’alerte : il faut étudier la sensibilité et comparer avec une méthode plus robuste.

Pour aller plus loin

La méthode de rééchantillonnage replace le jackknife dans la famille des procédés qui exploitent plusieurs versions d’un même échantillon.
La méthode de bootstrap montre l’alternative aléatoire avec remise, utile lorsque le retrait systématique décrit mal la variabilité de la statistique.
Le biais d’un estimateur précise ce que mesure la correction jackknife et pourquoi une estimation peut s’écarter systématiquement de la quantité visée.
Continuez avec Tangente

Explorez les mathématiques autrement

Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.

Découvrir les offres