Passer au contenu principal
Tangente

fluctuation d'échantillonnage

La fluctuation d’échantillonnage est la variabilité naturelle d’un indicateur statistique entre des échantillons tirés aléatoirement d’une même population selon un même mécanisme. Elle vient de leur composition aléatoire, même lorsque la population et le protocole ne changent pas. La loi d’échantillonnage de l’indicateur permet d’en quantifier l’ampleur, notamment pour construire des intervalles de confiance.
Deux échantillons de 100 réponses La première grille contient 46 cases rouges et la seconde 57, alors que le protocole est identique. Échantillon 1 Échantillon 2 46 oui sur 100 57 oui sur 100 oui non
À population et protocole identiques, les deux échantillons comptent 46 puis 57 réponses « oui » sur 100.
Sommaire

Ce que vous allez apprendre

  • Identifier ce qui varie entre deux échantillons d'une même population.
  • Calculer deux proportions et l'écart-type d'échantillonnage dans un modèle indépendant.
  • Distinguer fluctuation aléatoire, biais, erreur de mesure et intervalle de confiance.
  • Adapter l'interprétation aux tirages sans remise et aux petits échantillons.

En clair

Imaginez une population dont une personne sur deux répond « oui ». On tire au hasard 100 réponses, avec remise, puis on recommence exactement de la même façon. Le premier groupe peut contenir 46 « oui » et le second 57. Rien n'a changé dans la population : seule la composition aléatoire des groupes a changé. Cette variation inévitable des résultats, visible dans les deux grilles de 100 tirages, est la fluctuation d'échantillonnage.

Définition

La fluctuation d'échantillonnage est la variation d'un indicateur calculé sur plusieurs échantillons issus d'une même population. Elle concerne une proportion, une moyenne, un écart-type ou tout autre indicateur. Sa loi de probabilité, appelée loi d'échantillonnage de l'indicateur, dépend à la fois de la population, de la taille des échantillons et du mécanisme de tirage.
Dans le cas conducteur, chaque tirage indépendant donne « oui » avec une probabilité notée p, égale à 0,5. Le nombre de « oui », noté X, parmi n tirages suit alors une loi binomiale. La proportion observée, notée F, vaut F=XnF=\frac{X}{n}. Son espérance est p et son écart-type vaut σF=p(1p)n\sigma_F=\sqrt{\frac{p(1-p)}{n}}. Pour n = 100, cet écart-type vaut exactement 0,05.
Le tirage équiprobable avec remise rend ici les observations indépendantes. Sans remise dans une population finie, la loi et l'écart-type changent. Dans tous les cas, la fluctuation décrit ce que le hasard du plan d'échantillonnage peut produire ; elle ne corrige ni une sélection biaisée ni une mesure défectueuse.

Un exemple, pas à pas

Une population comporte autant de réponses « oui » que de réponses « non ». Deux échantillons indépendants de 100 réponses sont tirés avec remise.
Données : probabilité d'un « oui » p = 0,5 ; taille de chaque échantillon n = 100 ; premier nombre de « oui » X1 = 46 ; second nombre de « oui » X2 = 57.
1. Calculez la première proportion : F1 = 46 ÷ 100 = 0,46, soit 46 %.
2. Calculez la seconde : F2 = 57 ÷ 100 = 0,57, soit 57 %.
3. Leur écart vaut 0,57 − 0,46 = 0,11, soit 11 points de pourcentage.
4. Calculez l'écart-type théorique : σF=0,5(10,5)100=0,05\sigma_F=\sqrt{\frac{0{,}5(1-0{,}5)}{100}}=0{,}05.
Les deux proportions diffèrent malgré une population et un protocole identiques : c'est la fluctuation d'échantillonnage. Pour contrôler les calculs, 46 + 54 = 100 et 57 + 43 = 100 ; les deux grilles représentent donc bien 100 tirages chacune.

En pratique

Dans un sondage, on interprète l'écart entre une proportion observée et une valeur de référence à l'échelle de la fluctuation attendue. Si le plan de sélection n'est pas aléatoire, il faut d'abord étudier le biais de sélection : augmenter la taille ne le supprime pas.
Pour comparer deux séries de prélèvements ou de contrôles, on ne conclut pas à un changement dès que leurs moyennes diffèrent. On examine si l'écart dépasse ce que le protocole d'échantillonnage rend habituel ; si les mesures elles-mêmes sont imprécises, leur incertitude doit aussi être prise en compte.
Pour préparer une estimation, la taille de l'échantillon est choisie selon la précision recherchée. Dans le modèle indépendant d'une proportion, multiplier n par quatre divise l'écart-type par deux. Si le prélèvement représente une grande fraction d'une population finie, on emploie plutôt le modèle sans remise.

À ne pas confondre

Biais d'échantillonnage. La fluctuation change d'un tirage à l'autre et se décrit par une loi de probabilité. Un biais décale systématiquement les résultats parce que certaines personnes ont davantage de chances d'être retenues. Deux échantillons aléatoires donnant 46 % et 57 % illustrent une fluctuation ; interroger seulement un sous-groupe non représentatif relève du biais.
Erreur de mesure. La fluctuation vient des individus sélectionnés ; l'erreur de mesure vient de l'instrument ou du recueil. Changer les 100 personnes tout en gardant la même question produit une fluctuation. Obtenir une réponse différente parce que la question est mal enregistrée produit une erreur de mesure.
Intervalle de confiance. La fluctuation est le phénomène aléatoire des indicateurs. Un intervalle de confiance est une procédure construite à partir de cette variabilité pour encadrer un paramètre inconnu avec un niveau de confiance fixé. Observer 46 % est un résultat d'échantillon ; calculer un intervalle autour de l'estimation est une étape d'inférence.

Limites et pièges

Une formule dépend du plan de tirage. L'écart-type p(1p)n\sqrt{\frac{p(1-p)}{n}} suppose des tirages indépendants de même probabilité. Sans remise dans une population de taille N, il faut appliquer la correction finie NnN1\sqrt{\frac{N-n}{N-1}}. Le symptôme d'alerte est un échantillon qui représente une part non négligeable de la population.
Un petit échantillon fluctue davantage. Avec p = 0,5, l'écart-type d'une proportion vaut 0,05 pour n = 100, mais 0,10 pour n = 25. Une proportion éloignée de 50 % n'est donc pas, à elle seule, la preuve d'un changement de population ; il faut la rapporter à la taille et au modèle.
L'approximation normale a des limites. La règle p ± 1,96 fois l'écart-type décrit approximativement une zone centrale de 95 % lorsque la loi de la proportion est assez proche d'une loi normale. Avec peu d'observations ou une probabilité proche de 0 ou de 1, il faut utiliser la loi d'échantillonnage exacte ou une méthode adaptée.
La variabilité ne garantit pas la qualité des données. Des non-réponses, une sélection non aléatoire ou une question ambiguë peuvent produire un décalage que l'écart-type d'échantillonnage ne mesure pas. Le signe observable est un défaut stable du recueil ; il faut alors corriger le protocole avant d'interpréter la fluctuation.

Pour aller plus loin

La loi binomiale donne la distribution exacte du nombre de succès dans le modèle indépendant utilisé par l'exemple.
L'intervalle de confiance transforme la variabilité d'un estimateur en une procédure d'encadrement d'un paramètre inconnu.
L'article Les sondages à l'Insee : comment la statistique publique mesure la société replace l'échantillonnage dans une pratique statistique concrète.
Continuez avec Tangente

Explorez les mathématiques autrement

Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.

Découvrir les offres