Probabilités et statistiquesNotion · Glossaire
Inférentielle (statistique)
La statistique inférentielle utilise les données d'un échantillon pour tirer des conclusions sur la population dont il est issu. Elle sert à estimer des paramètres, tester des hypothèses ou prédire, en quantifiant l'incertitude plutôt qu'en décrivant seulement les observations. La validité de ses conclusions dépend d'un modèle probabiliste et d'hypothèses adaptées sur l'échantillonnage et la distribution des données.
Sommaire
Ce que vous allez apprendre
- Distinguer la population, l'échantillon, le paramètre et son estimation.
- Construire pas à pas un intervalle approximatif à 95 % pour une proportion.
- Situer les rôles respectifs de l'estimation, du test d'hypothèse et de la prédiction.
- Repérer un échantillon biaisé, une dépendance ignorée et une mauvaise lecture du niveau de confiance.
En clair
Un institut veut connaître l'opinion de toute une ville, mais il n'interroge que quelques centaines d'habitants choisis au hasard. Les réponses observées forment l'échantillon ; l'ensemble des habitants constitue la population.
La statistique inférentielle organise le passage de l'un à l'autre. Elle propose une valeur plausible pour la population et mesure l'incertitude due au fait que l'on n'en observe qu'une partie. Un autre échantillon donnerait probablement un résultat un peu différent : l'intervalle de confiance, le test ou la prédiction rendent cette variabilité explicite.
Définition
La statistique inférentielle étudie une population à partir d'un échantillon issu de cette population. Une caractéristique inconnue de la population, comme une moyenne ou une proportion, est appelée paramètre. Une fonction des observations fournit un estimateur du paramètre. L'estimation ponctuelle donne une valeur unique ; l'estimation par intervalle fournit un ensemble de valeurs compatibles avec les données à un niveau de confiance fixé.
Un test d'hypothèse confronte une hypothèse nulle à une hypothèse alternative. Il calcule, sous l'hypothèse nulle, à quel point le résultat observé serait inhabituel. Une prédiction porte plutôt sur une observation future ou encore inconnue. Ces trois démarches utilisent un modèle probabiliste pour relier la variabilité de l'échantillon à l'incertitude de la conclusion.
La validité de l'inférence dépend du plan d'échantillonnage et des hypothèses du modèle : indépendance éventuelle des observations, forme de leur distribution et mécanisme de sélection. Une grande taille d'échantillon réduit souvent l'incertitude aléatoire, mais elle ne corrige pas un échantillon biaisé. La statistique descriptive résume uniquement les données observées ; l'inférence franchit ce périmètre et doit donc annoncer l'incertitude ainsi que ses conditions de validité.
Un exemple, pas à pas
Une ville veut estimer la proportion de ses habitants favorables à un projet. Un échantillon aléatoire de 400 habitants donne 232 réponses favorables et 168 défavorables. On suppose les réponses indépendantes et l'échantillonnage non biaisé.
1. Estimation ponctuelle. La proportion observée, notée p̂, est le quotient du nombre de réponses favorables par l'effectif total.
La meilleure estimation ponctuelle fournie par cet échantillon est donc 58 %.
2. Erreur standard estimée. Pour cette proportion, elle vaut la racine carrée de p̂ multiplié par 1 − p̂, puis divisé par la taille n de l'échantillon.
La fluctuation type est d'environ 2,47 points de pourcentage.
3. Marge approximative à 95 %. L'approximation normale multiplie cette erreur standard par 1,96.
La marge est donc d'environ 4,84 points.
4. Intervalle. En retranchant puis en ajoutant cette marge à 0,58, on obtient approximativement [0,532 ; 0,628], soit [53,2 % ; 62,8 %]. Le schéma représente cette estimation et sa marge sur une même échelle.
5. Contrôle. Les deux bornes sont à 4,8 points de 58 % après arrondi au dixième de point. Si l'on répétait de très nombreux échantillonnages selon le même protocole, environ 95 % des intervalles ainsi construits contiendraient la proportion réelle. Ce niveau ne signifie pas que 95 % des habitants ont répondu favorablement.
En pratique
Dans un sondage, on estime une proportion de la population et on publie une marge d'erreur lorsque les personnes interrogées forment un échantillon. Si chaque membre de la population est observé, une description exhaustive suffit et l'incertitude d'échantillonnage disparaît.
En contrôle de production, on examine quelques objets pour estimer le taux de défaut de toute une série. Un intervalle approximatif convient lorsque les effectifs de défauts et de non-défauts sont assez grands ; avec très peu de défauts, une méthode binomiale exacte est préférable.
Pour comparer deux procédures, un test quantifie la compatibilité des données avec l'absence de différence. Une estimation accompagnée d'un intervalle reste préférable si la question porte sur la taille de l'écart, car un test seul ne dit pas si cet écart est important en pratique.
À ne pas confondre
Statistique descriptive. Elle résume les 400 réponses effectivement recueillies : 232 favorables, soit 58 %. La statistique inférentielle commence lorsqu'on utilise ce 58 % pour conclure sur tous les habitants, avec une marge d'incertitude.
Calcul des probabilités. Un modèle probabiliste donné permet de prévoir la fréquence possible des résultats. L'inférence suit le trajet inverse : elle part des résultats observés pour estimer les paramètres du modèle ou éprouver une hypothèse à leur sujet.
Limites et pièges
Échantillon biaisé. Si les 400 personnes proviennent d'un seul quartier ou répondent volontairement à une enquête ouverte, l'intervalle peut être très étroit tout en visant une mauvaise valeur. Il faut corriger le protocole de sélection ; augmenter seulement l'effectif ne supprime pas ce biais.
Approximation mal adaptée. Pour une proportion, le repère courant p̂n ≥ 10 et (1 − p̂)n ≥ 10 indique si l'approximation normale est raisonnable. Avec 232 et 168 observations, ces deux effectifs dépassent 10. Sinon, un intervalle binomial mieux adapté est requis.
Dépendance ignorée. Des réponses obtenues au sein des mêmes foyers peuvent se ressembler. Les traiter comme 400 observations indépendantes sous-estime alors l'incertitude. Il faut employer un modèle qui tient compte des groupes ou un plan d'échantillonnage correspondant.
Mauvaise lecture du niveau de confiance. Après calcul, l'intervalle fréquentiste obtenu ne donne pas une probabilité de 95 % à son paramètre fixe. Le 95 % qualifie la proportion d'intervalles qui couvriraient ce paramètre lors de répétitions du même protocole.
Pour aller plus loin
L'intervalle de confiance précise comment une procédure d'estimation par intervalle associe niveau annoncé, variabilité d'échantillonnage et couverture du paramètre.
L'écart-type approfondit la mesure de dispersion qui intervient dans de nombreuses erreurs standards et aide à quantifier la variabilité des observations.
Explorez les mathématiques autrement
Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.
Découvrir les offres
