Passer au contenu principal

statistique descriptive

La statistique descriptive regroupe les méthodes qui organisent, résument et représentent les données observées dans une population ou un échantillon. Elle en fait ressortir la distribution, la tendance centrale, la dispersion et, pour plusieurs variables, leurs relations, afin de rendre les données lisibles sans généraliser au-delà de ce qui a été observé.
Répartition de huit temps de trajet Huit durées de 12 à 30 minutes, un intervalle interquartile de 14 à 18 minutes, une médiane de 15,5 et une moyenne de 17,5. Huit temps de trajet intervalle interquartile 14–18 10 15 20 25 30 32 minutes médiane 15,5 moyenne 17,5
La valeur de 30 minutes étire la série vers la droite : la moyenne, 17,5, se place au-dessus de la médiane, 15,5.
Sommaire

Ce que vous allez apprendre

  • Distinguer indicateurs de position et de dispersion.
  • Refaire un calcul de médiane, quartiles, moyenne, variance et écart-type sur une même série.
  • Choisir entre résumé univarié, étude bivariée et analyse de nombreuses variables.
  • Repérer l'effet d'une valeur éloignée, d'une convention de quartiles ou d'un regroupement en classes.

En clair

Huit personnes indiquent leur temps de trajet : 12, 14, 15, 15, 16, 18, 20 et 30 minutes. La liste brute est exacte, mais elle ne se laisse pas saisir d'un regard. On peut la trier, la dessiner, repérer son centre et mesurer son étalement.
La statistique descriptive rassemble ces gestes. Elle transforme des observations en résumés lisibles, sans effacer la forme de leur répartition ni les valeurs atypiques.

Définition

La statistique descriptive est l'ensemble des méthodes qui organisent, résument et représentent les valeurs observées sur une population ou sur un échantillon. Elle commence par préciser les individus étudiés, les variables relevées et leurs unités. Une série univariée porte sur une variable ; une série bivariée met en regard deux variables observées sur les mêmes individus.
Pour une variable, les données peuvent être ordonnées ou regroupées en classes, puis représentées par des diagrammes ou des histogrammes. Les moyennes, la médiane, les quartiles, les déciles et les centiles renseignent leur position. L'écart interquartile et l'écart-type renseignent leur dispersion. Les coefficients d'asymétrie décrivent le déséquilibre de la distribution ; les coefficients d'aplatissement, dont le kurtosis, en caractérisent une autre forme. Le choix d'un indicateur dépend donc du type de variable et de la question posée.
Avec deux variables quantitatives, un coefficient de corrélation décrit l'intensité d'une liaison, tandis qu'un coefficient de détermination intervient notamment dans l'étude d'une régression linéaire. Pour de vastes ensembles comportant de nombreuses variables, l'analyse des données prolonge cette démarche exploratoire : analyse factorielle (AF), analyse en composantes principales (ACP), analyse factorielle de dissimilarités, analyse canonique, analyse factorielle discriminante (AFD) ou analyse factorielle des correspondances (AFC).

Un exemple, pas à pas

On observe huit temps de trajet, en minutes : 12, 14, 15, 15, 16, 18, 20 et 30. L'effectif est 8 et les valeurs sont déjà rangées dans l'ordre croissant.
1. La médiane est la moyenne des quatrième et cinquième valeurs : (15 + 16) ÷ 2 = 15,5 minutes.
2. Avec la convention usuelle des rangs entiers en France, le premier quartile est la deuxième valeur, soit 14 minutes, et le troisième quartile est la sixième, soit 18 minutes. L'écart interquartile vaut donc 18 − 14 = 4 minutes.
3. La moyenne vaut (12 + 14 + 15 + 15 + 16 + 18 + 20 + 30) ÷ 8 = 17,5 minutes. Pour l'écart-type de cette population de huit observations, la variance est la moyenne des carrés des écarts à 17,5 :
σ2=(1217,5)2+(1417,5)2+2(1517,5)2+(1617,5)2+(1817,5)2+(2017,5)2+(3017,5)28=220,258=27,53125\sigma^2=\frac{(12-17{,}5)^2+(14-17{,}5)^2+2(15-17{,}5)^2+(16-17{,}5)^2+(18-17{,}5)^2+(20-17{,}5)^2+(30-17{,}5)^2}{8}=\frac{220{,}25}{8}=27{,}53125
4. L'écart-type est la racine carrée de 27,53125, soit environ 5,25 minutes. Le contrôle est refaisable : les huit durées totalisent 140 minutes, et 140 ÷ 8 redonne bien la moyenne de 17,5 minutes. La valeur de 30 minutes explique que la moyenne dépasse la médiane.

En pratique

Pour rendre compte d'une série de durées, on examine d'abord les valeurs ordonnées. La médiane et l'écart interquartile sont particulièrement lisibles lorsqu'une valeur éloignée, comme 30 minutes dans l'exemple, tire la moyenne vers le haut.
Pour comparer plusieurs groupes, on conserve les mêmes unités et les mêmes conventions de calcul. Un histogramme convient à des valeurs quantitatives regroupées en classes ; des indicateurs chiffrés permettent ensuite de comparer centre et dispersion.
Lorsque deux variables sont relevées sur chaque individu, un nuage de points et une corrélation peuvent révéler une liaison. Si le but est d'ajuster une relation linéaire, la régression et son coefficient de détermination deviennent plus adaptés.
Lorsque le nombre de variables rend les résumés séparés illisibles, les méthodes d'analyse des données, comme l'ACP ou l'AFC, recherchent des structures synthétiques adaptées à la nature des données.

À ne pas confondre

Indicateur de position et indicateur de dispersion. La médiane ou une moyenne situe le centre d'une série ; l'écart interquartile ou l'écart-type mesure son étalement. Deux séries peuvent avoir la même médiane sans présenter la même dispersion : l'égalité des centres ne suffit donc pas à les décrire comme semblables.
Corrélation et régression linéaire. Un coefficient de corrélation résume une liaison entre deux variables. Une régression linéaire ajuste un modèle reliant une variable à l'autre. Une corrélation élevée ne fournit pas, à elle seule, l'équation ajustée ni une relation de cause à effet.

Limites et pièges

Une seule valeur peut déplacer fortement la moyenne. Dans la série des trajets, remplacer 30 par 60 minutes ferait passer la moyenne de 17,5 à 21,25 minutes, tandis que la médiane resterait 15,5 minutes. Il faut donc regarder aussi la série ordonnée et des indicateurs robustes comme la médiane et l'écart interquartile.
Les quartiles dépendent d'une convention. Pour un petit effectif, plusieurs règles de calcul peuvent donner des valeurs différentes. Il faut annoncer la convention retenue ; l'exemple emploie les rangs entiers usuels en France.
Un regroupement en classes masque des détails. Deux découpages du même ensemble peuvent produire des histogrammes d'allures différentes. Il faut contrôler les bornes et les largeurs de classes, puis conserver les données non regroupées lorsqu'elles sont disponibles.
Une liaison résumée n'est pas toute la relation. Une corrélation ou un coefficient de détermination doit être interprété avec le nuage de points et le modèle choisi. Une structure non linéaire ou une valeur atypique peut rendre un résumé linéaire trompeur.

Pour aller plus loin

Le quartile précise le découpage ordonné d'une série, tandis que l'écart-type approfondit la mesure de sa dispersion.
La Régression linéaire développe l'ajustement entre deux variables. L'analyse en composantes principales montre comment résumer un ensemble comportant plusieurs variables quantitatives.
Continuez avec Tangente

Explorez les mathématiques autrement

Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.

Découvrir les offres