Probabilités et statistiquesNotion · Glossaire
intervalle de confiance
Un intervalle de confiance est un intervalle calculé à partir d’un échantillon par une méthode qui, sous ses hypothèses, contient le paramètre inconnu dans une proportion donnée des répétitions : le niveau de confiance. Il quantifie l’incertitude de l’estimation ; plus on exige un niveau élevé, plus l’intervalle est généralement large, et sa demi-largeur est la marge d’erreur.
Sommaire
Ce que vous allez apprendre
- Distinguer l’estimation ponctuelle de l’intervalle qui l’entoure.
- Recalculer un intervalle approximatif à 95 % pour une proportion observée.
- Interpréter correctement le niveau de confiance et la marge d’erreur.
- Repérer les biais et les cas où l’approximation normale convient mal.
En clair
Un sondage interroge 1 000 personnes et obtient 52 % de réponses favorables. Ce résultat donne un point de repère, mais un autre échantillon aurait probablement fourni un pourcentage un peu différent.
L’intervalle de confiance entoure donc l’estimation d’une zone d’incertitude. Ici, un calcul usuel donne environ 48,9 % à 55,1 %. Le niveau de confiance décrit la fiabilité à long terme de la méthode : en répétant les sondages, 95 % des intervalles ainsi construits contiendraient la proportion réelle.
Définition
Un intervalle de confiance est calculé à partir d’un échantillon pour estimer un paramètre inconnu d’une population. Ce paramètre peut être une moyenne, une médiane, une proportion ou une variance. La construction dépend du paramètre visé, du modèle statistique et des hypothèses retenues sur l’échantillonnage.
Pour une méthode de niveau 95 %, la procédure produit, sur un grand nombre d’échantillons comparables, environ 95 % d’intervalles contenant la vraie valeur du paramètre. Dans l’interprétation fréquentiste, le paramètre est fixe et l’intervalle varie avec l’échantillon. Après observation des données, on ne peut donc pas affirmer sans modèle probabiliste supplémentaire que la valeur fixe a 95 % de probabilité d’appartenir à l’intervalle obtenu.
À données et méthode identiques, exiger un niveau de confiance plus élevé élargit généralement l’intervalle. Pour un intervalle symétrique autour de l’estimation, la marge d’erreur est sa demi-largeur : si les bornes sont notées a et b, elle vaut . Une petite marge d’erreur indique davantage de précision, mais elle ne garantit ni l’absence de biais ni la représentativité de l’échantillon.
Un exemple, pas à pas
Un sondage aléatoire simple interroge 1 000 personnes indépendantes. Parmi elles, 520 donnent une réponse favorable. On cherche un intervalle approximatif de niveau 95 % pour la proportion de réponses favorables dans la population.
Données. La taille de l’échantillon, notée n, vaut 1 000. La proportion observée, notée p̂, vaut 520 ÷ 1 000 = 0,52.
1. L’erreur-type estimée de la proportion vaut , soit environ 0,0158.
2. Pour le niveau 95 %, l’approximation normale emploie le coefficient 1,96. La marge d’erreur vaut donc 1,96 × 0,0158 ≈ 0,031, soit 3,1 points de pourcentage.
3. Les bornes sont 0,52 − 0,031 ≈ 0,489 et 0,52 + 0,031 ≈ 0,551. L’intervalle obtenu est donc approximativement [48,9 % ; 55,1 %].
Le contrôle est immédiat : le centre de 48,9 % et 55,1 % est 52 %, et chaque borne se trouve à 3,1 points du centre. La représentation graduée rend visibles cette symétrie et la marge d’erreur.
En pratique
Dans un sondage, l’intervalle accompagne le pourcentage publié. Le lecteur regarde ses bornes plutôt que le seul résultat central, surtout lorsque deux options sont séparées par moins que la marge d’erreur.
Pour comparer deux estimations, on calcule de préférence un intervalle portant directement sur leur différence. Le simple chevauchement de deux intervalles séparés n’est pas toujours un critère correct de différence statistique.
Lorsque l’échantillon est petit ou que la proportion observée est proche de 0 % ou de 100 %, l’approximation normale peut être médiocre. Une méthode binomiale adaptée, comme un intervalle exact ou celui de Wilson, devient préférable.
Avant toute interprétation, on examine aussi le recrutement des personnes interrogées. Augmenter la taille réduit l’erreur d’échantillonnage, mais ne corrige pas un questionnaire orienté, des non-réponses systématiques ou un échantillon non représentatif.
À ne pas confondre
Intervalle de confiance et intervalle de prédiction. Le premier encadre un paramètre de population ; le second encadre une future observation. Pour prévoir la réponse d’une personne, un intervalle de prédiction est pertinent et il est généralement plus large.
Niveau de confiance et probabilité a posteriori. Un niveau de 95 % qualifie la fréquence de succès de la procédure avant l’observation. Une probabilité de 95 % attribuée au paramètre après observation relève d’un intervalle bayésien et suppose notamment une loi a priori.
Marge d’erreur et erreur constatée. La marge d’erreur mesure l’incertitude d’échantillonnage annoncée par le modèle. L’écart réel entre 52 % et la proportion inconnue ne peut pas être observé tant que cette proportion n’est pas connue.
Limites et pièges
Échantillon biaisé. Des bornes très serrées peuvent donner une fausse impression de sûreté si certaines catégories sont sous-représentées. Il faut corriger le plan d’échantillonnage ou expliciter ce biais, plutôt que présenter la marge d’erreur comme une incertitude totale.
Approximation normale fragile. Dans l’exemple, les nombres attendus de réponses favorables et défavorables valent 520 et 480, très au-dessus du repère courant de 10. Si l’un des deux tombe sous 10, il faut préférer une méthode binomiale mieux adaptée.
Lecture après calcul. Pour l’intervalle déjà obtenu [48,9 % ; 55,1 %], la proportion réelle est fixe : elle appartient ou non à ces bornes. Le 95 % porte sur la méthode de construction répétée, pas sur un tirage ultérieur du paramètre.
Multiplication des analyses. Construire séparément de nombreux intervalles à 95 % augmente la probabilité qu’au moins l’un manque sa cible. Pour garantir une couverture globale, il faut employer une méthode d’intervalles simultanés ou ajuster le niveau.
Pour aller plus loin
L’article Statistiques et probabilités revisitées replace l’estimation dans un panorama plus large des liens entre données observées, modèles probabilistes et raisonnement statistique.
Explorez les mathématiques autrement
Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.
Découvrir les offres
