Passer au contenu principal
Probabilités et statistiquesMéthode · Glossaire

méthode de bootstrap

Le bootstrap est une méthode d'inférence statistique qui estime la distribution d'une statistique en générant de nombreux rééchantillons de même taille, tirés avec remise dans l'échantillon observé. La variabilité des valeurs recalculées permet notamment d'estimer une erreur standard ou un intervalle de confiance, sans imposer de modèle paramétrique. Sa validité suppose que l'échantillon représente la population et, dans sa version ordinaire, que les observations soient indépendantes et de même loi.
Tirer avec remise fait varier la moyenne Une ligne source et trois rééchantillons de cinq durées conduisent aux moyennes 5, 6, 5,6 et 3,4 minutes. Tirer avec remise fait varier la moyenne SourceABC 244510 2441010 445510 22445 moyenne = 5 minmoyenne = 6 minmoyenne = 5,6 minmoyenne = 3,4 min
Chaque ligne reprend cinq valeurs observées ; les doublons changent la moyenne sans introduire de nouvelle durée.
Sommaire

Ce que vous allez apprendre

  • Suivre un rééchantillonnage avec remise sur cinq durées.
  • Relier la distribution bootstrap à l'erreur standard et aux intervalles de confiance.
  • Reconnaître les cas où la dépendance, le biais ou une statistique irrégulière imposent une autre méthode.
  • Distinguer le bootstrap du jackknife et de la simulation paramétrique.

En clair

On a mesuré cinq durées : 2, 4, 4, 5 et 10 minutes. Pour savoir si leur moyenne est stable, le bootstrap remet ces cinq valeurs dans un sac virtuel. Il en tire cinq avec remise : une valeur peut donc revenir plusieurs fois et une autre disparaître.
En répétant ce tirage des centaines ou des milliers de fois, on obtient autant de moyennes légèrement différentes. Leur dispersion renseigne sur l'incertitude de la moyenne calculée à partir des cinq mesures initiales.

Définition

Le bootstrap approche la distribution d'échantillonnage d'une statistique à partir de la distribution empirique des données observées. Pour un échantillon de taille n, cette distribution empirique attribue la probabilité 1/n à chacune des n observations, en comptant leurs éventuelles répétitions.
Un échantillon bootstrap est formé par n tirages indépendants avec remise dans l'échantillon initial. On calcule sur lui la même statistique, notée T*. Aprè B répétitions, les valeurs T1*, ..., TB* forment une approximation Monte-Carlo de la loi bootstrap de T, conditionnellement aux données observées. Leur écart-type estime l'erreur standard ; leurs quantiles peuvent fournir un intervalle percentile.
La version ordinaire convient surtout à des observations indépendantes et représentatives. Elle évite de choisir une loi paramétrique pour la distribution de la statistique, mais elle ne supprime ni les hypothèses sur la collecte des données ni le biais de l'échantillon initial. Des données dépendantes ou structurées demandent un schéma adapté, par exemple un bootstrap par blocs ou stratifié.

Le principe

Si les n observations peuvent être traitées comme des réalisations indépendantes d'une même population, alors on tire avec remise n valeurs dans l'échantillon, puis on recalcule la statistique d'intérêt. On répète l'opération B fois. La distribution des B résultats sert d'approximation à la distribution d'échantillonnage recherchée ; on arrête lorsque l'estimation visée, comme une erreur standard ou des quantiles, devient numériquement stable.

Quand l'utiliser

Le bootstrap ordinaire exige un échantillon qui reflète raisonnablement la population, une statistique calculable sur chaque rééchantillon et un nombre B de répétitions suffisant pour stabiliser le résultat. L'indépendance des observations est une condition centrale du tirage individuel avec remise.
Une série de températures relevées minute après minute fournit un contre-cas : deux mesures voisines peuvent être dépendantes. Les tirer séparément efface cette structure et sous-estime parfois l'incertitude. Il faut alors rééchantillonner des blocs consécutifs, ou employer un modèle qui conserve la dépendance. De même, le bootstrap ne corrige pas un biais de sélection présent dans les données.

Un exemple, pas à pas

Cinq durées indépendantes ont été observées : 2, 4, 4, 5 et 10 minutes. La statistique étudiée est leur moyenne. La moyenne initiale vaut (2 + 4 + 4 + 5 + 10) / 5 = 5 minutes.
1. On tire cinq valeurs avec remise. Un premier rééchantillon possible est 2, 4, 4, 10, 10.
2. Sa moyenne vaut (2 + 4 + 4 + 10 + 10) / 5 = 6 minutes.
3. Deux autres tirages possibles donnent 4, 4, 5, 5, 10, de moyenne 5,6 minutes, puis 2, 2, 4, 4, 5, de moyenne 3,4 minutes.
4. En pratique, on produit un grand nombre B de tels résultats, pas seulement trois.
La répartition des B moyennes estime l'incertitude autour de 5 minutes. Un contrôle simple consiste à recompter cinq valeurs dans chaque ligne et à vérifier que chacune appartient bien à l'échantillon initial. Les trois moyennes illustrées ne suffisent pas, à elles seules, à calculer un intervalle de confiance fiable.

En pratique

Pour une moyenne dont la formule théorique d'erreur standard est mal adaptée ou difficile à justifier, on rééchantillonne les observations et on mesure la dispersion des moyennes obtenues. Une formule paramétrique reste préférable lorsqu'un modèle bien établi la rend exacte et plus efficace.
Pour un intervalle de confiance, on peut lire des quantiles dans la distribution bootstrap. Si cette distribution est très asymétrique ou si la statistique est biaisée, l'intervalle percentile simple peut être trompeur ; une méthode corrigée ou une modélisation explicite devient alors plus pertinente.
Pour des données groupées par classe, site ou individu, le geste utile consiste à rééchantillonner les unités au niveau où elles sont indépendantes. Tirer toutes les lignes comme si elles l'étaient sous-estimerait l'incertitude ; un bootstrap par grappes conserve la structure observée.

À ne pas confondre

Bootstrap et jackknife. Le bootstrap tire avec remise des échantillons de taille n et peut en produire autant que souhaité. Le jackknife supprime successivement une observation : avec cinq valeurs, il construit cinq échantillons de taille quatre. Pour ces deux versions ordinaires — bootstrap de taille n et jackknife delete-1 —, le nombre de données par rééchantillon permet de trancher ; ce critère ne suffit plus pour leurs variantes.
Bootstrap et simulation paramétrique. Le bootstrap non paramétrique tire parmi les valeurs observées. Une simulation paramétrique tire dans une loi ajustée, qui peut produire des valeurs absentes de l'échantillon. Avec les durées 2, 4, 4, 5 et 10, obtenir 6,2 dans un tirage révèle que l'on ne pratique pas le bootstrap ordinaire.

Limites et pièges

Petit échantillon pauvre en information. Avec une seule observation, tous les rééchantillons sont identiques et l'erreur standard bootstrap vaut 0. Ce résultat ne prouve aucune certitude : il signale que les données ne permettent pas d'estimer la variabilité. Il faut recueillir davantage d'observations ou poser un modèle justifié.
Valeur rare absente. Le rééchantillonnage ne peut produire que des valeurs déjà observées. Si l'échantillon initial manque un événement rare important, aucun grand nombre de répétitions ne le recréera. Il faut améliorer l'échantillonnage ou introduire un modèle du phénomène.
Dépendance ignorée. Une distribution bootstrap anormalement resserrée peut venir d'observations corrélées tirées isolément. Il faut conserver les blocs, grappes, paires ou strates qui portent la dépendance, plutôt que d'appliquer automatiquement le tirage individuel.
Statistique irrégulière. Pour un maximum, une frontière ou certains estimateurs discontinus, le bootstrap ordinaire peut mal reproduire la loi d'échantillonnage. Une forte instabilité quand on change la taille des rééchantillons est un signal d'alerte ; une méthode spécialisée ou une analyse théorique est alors nécessaire.

Pour aller plus loin

La méthode de rééchantillonnage replace le bootstrap dans la famille des procédures qui réutilisent les données observées.
L'intervalle de confiance précise ce que couvre l'intervalle construit à partir des quantiles bootstrap.
La méthode de jackknife permet de comparer le tirage avec remise à la suppression successive d'une observation.
Continuez avec Tangente

Explorez les mathématiques autrement

Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.

Découvrir les offres