Probabilités et statistiquesNotion · Glossaire
maximum de vraisemblance
L'estimation par maximum de vraisemblance infère les paramètres d'un modèle probabiliste à partir d'un échantillon observé, dont la loi est supposée dépendre de ces paramètres. Elle retient, parmi les valeurs admissibles, celle ou celles qui maximisent la probabilité de l'échantillon si les observations sont discrètes, ou sa densité si elles sont continues. Autrement dit, elle choisit les paramètres sous lesquels les données observées sont les plus plausibles.
Sommaire
Ce que vous allez apprendre
- Interpréter la vraisemblance en gardant les données fixes et en faisant varier le paramètre.
- Calculer l'estimateur de Bernoulli pour sept succès sur dix essais.
- Reconnaître les limites liées au petit échantillon, aux frontières et au modèle choisi.
En clair
Une pièce est lancée dix fois et tombe sept fois sur face. Sa tendance inconnue à donner face pourrait valoir 20 %, 70 % ou 90 %. Pour départager ces valeurs, on demande pour chacune : « Si cette valeur était la bonne, à quel point les sept faces et trois piles observés seraient-ils vraisemblables ? »
Le maximum de vraisemblance retient la valeur qui rend les données observées les plus plausibles dans le modèle choisi. Ici, cette valeur est 70 %. La méthode ne prétend pas que le paramètre a 70 % de chances d'être vrai : elle compare les paramètres en gardant l'échantillon fixe.
Définition
Le maximum de vraisemblance est une règle d'estimation des paramètres d'un modèle probabiliste. On observe un échantillon, noté x, dont la loi dépend d'un paramètre θ ou d'un vecteur de paramètres. La fonction de vraisemblance associe à chaque valeur admissible de θ la probabilité de l'échantillon si les observations sont discrètes, ou sa densité si elles sont continues. L'échantillon reste fixé et θ varie.
L'estimateur, noté θ̂, est une valeur admissible qui maximise cette fonction : . L'ensemble Θ rassemble les valeurs possibles du paramètre. Le maximum peut être non unique ; l'écriture avec « arg max » désigne alors l'ensemble des maximisateurs. Quand la vraisemblance est positive, maximiser son logarithme donne les mêmes maximisateurs, car le logarithme est strictement croissant.
Pour des observations indépendantes, la vraisemblance est le produit de leurs probabilités ou densités sous le modèle. La log-vraisemblance transforme ce produit en somme, ce qui facilite souvent le calcul. Introduite par Ronald Aylmer Fisher, la méthode fournit, sous des conditions de régularité, des estimateurs convergents, asymptotiquement sans biais et asymptotiquement efficaces. Ces propriétés portent sur la limite quand la taille de l'échantillon augmente ; elles ne garantissent ni absence de biais ni optimalité pour un petit échantillon.
Un exemple, pas à pas
On modélise dix lancers indépendants d'une même pièce par une loi de Bernoulli. Le paramètre p désigne la probabilité inconnue d'obtenir face à chaque lancer. Les données sont : 10 lancers, 7 faces et 3 piles. On suppose que 0 ≤ p ≤ 1 et que la probabilité p reste la même d'un lancer à l'autre.
1. Pour les dix résultats individuels, la vraisemblance vaut .
2. Pour 0 < p < 1, sa log-vraisemblance est .
3. Sa dérivée s'annule lorsque .
4. Cette équation donne exactement p = 7/10.
2. Pour 0 < p < 1, sa log-vraisemblance est .
3. Sa dérivée s'annule lorsque .
4. Cette équation donne exactement p = 7/10.
L'estimation par maximum de vraisemblance est donc p̂ = 0,7, soit 70 %. Un contrôle direct est possible : la log-vraisemblance est strictement concave sur l'intervalle ouvert, puisque sa dérivée seconde y est négative. Aux deux extrémités p = 0 et p = 1, la vraisemblance vaut 0 pour cet échantillon mêlant faces et piles. Le point p = 0,7 est donc bien l'unique maximum global.
En pratique
Pour estimer une proportion à partir de résultats binaires, on écrit la vraisemblance du nombre de succès et d'échecs, puis on cherche la proportion qui la maximise. Dans l'exemple des dix lancers, ce geste transforme les 7 faces observées en l'estimation p̂ = 0,7.
Quand un modèle comporte plusieurs paramètres, on construit une vraisemblance commune et on cherche le meilleur vecteur de valeurs. La log-vraisemblance est préférée au produit brut lorsque celui-ci devient numériquement minuscule : elle conserve le même optimum tout en remplaçant les multiplications par des additions.
Avant d'interpréter le résultat, on vérifie que les données peuvent raisonnablement suivre la loi choisie et que le paramètre reste dans son domaine admissible. Si le modèle ou l'indépendance des observations est inadapté, changer de modèle est plus pertinent que raffiner l'optimisation.
À ne pas confondre
Vraisemblance et probabilité du paramètre. La vraisemblance compare des valeurs de θ pour des données déjà fixées ; ce n'est pas une distribution de probabilité sur θ. Dans les dix lancers, p̂ = 0,7 signifie que 0,7 maximise la vraisemblance, non que p a 70 % de chances de valoir exactement 0,7.
Maximum de vraisemblance et rapport de vraisemblance. Le premier choisit un paramètre qui maximise L. Le second divise deux vraisemblances pour comparer des hypothèses ou des modèles. Chercher p̂ = 0,7 relève du maximum ; comparer L(0,7) à L(0,5) forme un rapport.
Limites et pièges
Petit échantillon. Les bonnes propriétés citées sont asymptotiques. Avec seulement dix lancers, p̂ = 0,7 peut encore varier fortement d'un échantillon à l'autre. Il faut quantifier cette incertitude au lieu de lire l'estimation comme la valeur certaine du paramètre.
Maximum sur la frontière. Si les dix lancers donnaient tous face, la vraisemblance p10 serait maximale en p = 1. La dérivée ne s'annulerait pas à l'intérieur de l'intervalle : il faudrait examiner les bornes du domaine, et non conclure qu'aucun maximum n'existe.
Existence et unicité. Une vraisemblance peut avoir plusieurs maxima ou seulement une borne supérieure non atteinte. Un solveur peut aussi s'arrêter sur un maximum local. Il faut étudier le domaine des paramètres, comparer les candidats et annoncer l'ensemble des solutions lorsque le maximisateur n'est pas unique.
Modèle mal choisi. Une optimisation exacte ne corrige pas une loi inadaptée, une dépendance ignorée ou un paramètre non identifiable. Le symptôme est que plusieurs valeurs produisent la même distribution, ou que les observations contredisent nettement les hypothèses. Il faut alors revoir le modèle ou recueillir des données plus informatives.
Pour aller plus loin
La loi de Bernoulli formalise chaque lancer à deux issues et montre pourquoi la vraisemblance de l'exemple contient sept facteurs p et trois facteurs 1 − p.
La loi binomiale regroupe le nombre de succès sur plusieurs essais indépendants et éclaire la même estimation lorsque seul le total des faces est conservé.
Le rapport de vraisemblance prolonge l'idée en comparant les niveaux de vraisemblance de deux hypothèses, plutôt qu'en recherchant seulement le paramètre maximisant.
Explorez les mathématiques autrement
Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.
Découvrir les offres
