cumulative distribution function
Choisissez un seuil : la fonction de répartition cumule les probabilités de toutes les valeurs qui ne le dépassent pas. Avec un dé équilibré à six faces et le seuil 3, elle additionne ainsi les chances d'obtenir 1, 2 ou 3. L'exemple guidé montre ce calcul pas à pas ; les sections suivantes donnent ensuite la définition formelle, les propriétés, le cas continu à densité et la fonction de répartition empirique.
Contents
What you will learn
- Relier F_X(x) à la probabilité de ne pas dépasser un seuil.
- Calculer F_X(3) pour un dé équilibré et contrôler le résultat.
- Distinguer le cumul discret de l'intégration d'une densité continue.
- Interpréter les sauts, la borne incluse et une fonction de répartition empirique.
In plain terms
Lancez un dé équilibré à six faces et choisissez un seuil, par exemple 3. La fonction de répartition additionne les chances d'obtenir 1, 2 ou 3. Elle répond donc à une question cumulative : quelle est la probabilité que le résultat ne dépasse pas ce seuil ?
Quand le seuil avance de 1 à 6, la probabilité cumulée monte par marches de 1/6, jusqu'à atteindre 1. Elle ne peut jamais redescendre, puisque chaque nouveau seuil conserve les résultats déjà comptés.
Definition
Soit une variable aléatoire notée X. Sa fonction de répartition, notée FX, associe à tout nombre réel x la probabilité que X soit inférieure ou égale à x : . Cette définition vaut pour une variable discrète, continue ou mêlant ces deux comportements.
La fonction FX est croissante et continue à droite. Sa valeur tend vers 0 lorsque x tend vers −∞, et vers 1 lorsque x tend vers +∞. Ces propriétés caractérisent les fonctions de répartition. Un saut en un nombre a mesure exactement la probabilité P(X = a).
Si X est continue et possède une densité notée fX, la probabilité cumulée s'obtient en intégrant cette densité depuis −∞ : . À partir d'un échantillon, la fonction de répartition empirique remplace la loi inconnue par la proportion d'observations inférieures ou égales à x. Le théorème de Glivenko-Cantelli affirme que cette fonction empirique converge presque sûrement et uniformément vers la vraie fonction de répartition quand la taille de l'échantillon augmente.
What it is made of
Une fonction de répartition réunit cinq éléments. La variable aléatoire X fournit les valeurs possibles. Le nombre réel x joue le rôle de seuil. L'événement « X ≤ x » rassemble toutes les valeurs qui ne dépassent pas ce seuil. La probabilité de cet événement donne FX(x). Enfin, l'ensemble de ces résultats forme la courbe de la fonction.
La loi de X détermine donc la hauteur de la courbe à chaque seuil, tandis qu'un déplacement du seuil modifie l'événement compté. Pour une loi discrète, chaque valeur de probabilité positive produit un saut. Pour une loi continue à densité, l'accumulation est décrite par une intégrale et la courbe ne saute pas. La couleur, l'échelle et le style du tracé ne définissent pas la fonction : seules les probabilités cumulées comptent. Elles suffisent à retrouver la probabilité de tout intervalle de la forme ]a, b] grâce à la différence FX(b) − FX(a).
A step-by-step example
On lance un dé équilibré à six faces et l'on note X le résultat. Les données sont les valeurs 1, 2, 3, 4, 5 et 6, chacune de probabilité 1/6. On cherche la probabilité que le résultat ne dépasse pas 3.
1. Le seuil choisi est x = 3. L'événement « X ≤ 3 » contient exactement les résultats 1, 2 et 3.
2. On additionne les trois probabilités : .
3. On simplifie le résultat : FX(3) = 1/2. La probabilité cherchée vaut donc 50 %.
4. Le contrôle consiste à compter les issues favorables : trois faces sur six satisfont la condition, ce qui redonne 3/6.
La courbe en escalier encode le même calcul pour tous les seuils : elle reste constante entre deux entiers et gagne 1/6 à chaque face du dé.
In practice
Pour évaluer un seuil, on lit directement FX(x) lorsque la question porte sur « au plus x » ou « inférieur ou égal à x ». Si la question porte sur un intervalle ]a, b], on préfère la différence FX(b) − FX(a).
Avec des observations, on trace la fonction de répartition empirique pour voir quelle proportion des données reste sous chaque valeur. Un histogramme est préférable si l'on veut surtout observer des fréquences par classes plutôt qu'un cumul.
Pour comparer deux distributions, on superpose leurs fonctions de répartition et l'on observe leurs écarts verticaux. Si l'objectif est seulement de comparer une moyenne ou une dispersion, des indicateurs résumés sont plus directs, mais ils ne décrivent pas toute la distribution.
Not to be confused with
Densité de probabilité. Une densité donne une concentration locale, tandis qu'une fonction de répartition donne une probabilité cumulée. Pour une variable continue, la hauteur fX(x) n'est généralement pas une probabilité ; l'aire jusqu'à x vaut FX(x).
Fonction de survie. Elle mesure la probabilité de dépasser strictement le seuil. Au même nombre x, la fonction de survie vaut 1 − FX(x), alors que la fonction de répartition compte X ≤ x.
Fonction quantile. La fonction de répartition part d'un seuil pour donner une probabilité. La fonction quantile effectue le trajet inverse : elle part d'un niveau de probabilité et fournit un seuil correspondant.
Limits and pitfalls
Un saut n'est pas une erreur. Si X peut prendre une valeur a avec une probabilité positive, FX saute en a. La hauteur du saut est exactement P(X = a) ; il faut donc conserver cette marche au lieu de lisser la courbe.
L'intégrale exige une densité. La formule ne s'applique pas à toute variable aléatoire. Pour le dé, les probabilités se somment ; aucune densité ordinaire ne produit ses sauts.
La borne est incluse. FX(x) compte X ≤ x, pas seulement X < x. Sur le dé, FX(3) = 1/2, tandis que P(X < 3) = 2/6. À un point de saut, oublier l'égalité change donc le résultat.
L'empirique n'est pas immédiatement la vraie loi. Avec un échantillon fini, la courbe empirique dépend des observations et peut s'écarter de FX. Le théorème de Glivenko-Cantelli garantit une convergence presque sûre et uniforme quand la taille de l'échantillon tend vers l'infini, pas une égalité pour une taille donnée.
Further reading
Variable aléatoire — Pour revoir l'objet dont la fonction de répartition décrit les probabilités cumulées.
Densité de probabilité — Pour relier aire sous une densité et probabilité cumulée dans le cas continu.
Explore mathematics differently
Discover our magazines, podcasts and games to explore mathematics differently.
See our offers
