Probabilités et statistiquesNotion · Glossaire
Rapport de vraisemblance
Le rapport de vraisemblance est une statistique de test utilisée en inférence statistique pour comparer une hypothèse nulle à un modèle non contraint qui la contient. Dans la convention du rapport de vraisemblance généralisé, il est défini comme le rapport de la vraisemblance maximale dans le modèle non contraint sur la vraisemblance maximale sous l'hypothèse nulle. Un rapport de vraisemblance grand est en faveur du modèle non contraint. Le test du rapport de vraisemblance, aussi appelé test de Wilks, repose sur le fait que, sous certaines conditions de régularité, la statistique 2 fois le logarithme de ce rapport suit asymptotiquement une loi du chi-deux.
Sommaire
Ce que vous allez apprendre
- Distinguer les conventions alternative sur nulle et nulle sur alternative.
- Calculer un rapport de vraisemblance à partir de deux maxima.
- Transformer le rapport en statistique de Wilks avec le bon signe.
- Interpréter une valeur de 4,03 avec un chi-deux à un degré de liberté.
- Reconnaître les cas où l’approximation asymptotique ou la comparaison emboîtée ne convient pas.
En clair
Une pièce donne 60 faces en 100 lancers. Deux explications sont mises en concurrence : la pièce est équilibrée, ou sa probabilité de tomber sur face peut différer de 1/2. Pour chacune, on cherche le réglage qui rend les 60 faces observées les plus vraisemblables. Le quotient des deux résultats mesure alors combien le meilleur réglage de la seconde explication s’accorde mieux aux données. Plus ce quotient dépasse 1, plus les observations favorisent cette seconde explication.
Définition
Pour des données observées notées x et un paramètre noté θ, la vraisemblance L(θ ; x) mesure à quel point une valeur de θ rend x plausible dans le modèle choisi. L’hypothèse nulle H0 restreint θ à un ensemble Θ0. Le modèle non contraint autorise θ à parcourir un espace paramétrique Θ1 plus large, contenant Θ0 ; il sert à calculer le maximum alternatif du rapport de vraisemblance généralisé. Chaque vraisemblance est maximisée sur l’ensemble correspondant.
Deux conventions réciproques coexistent. Si le rapport R place l’alternative au numérateur, alors et R est au moins égal à 1. La convention de Wilks emploie plutôt le rapport nul sur alternative, noté Λ = 1/R, compris entre 0 et 1. La statistique de test s’écrit donc indifféremment .
Quand les modèles sont emboîtés et satisfont les conditions de régularité, W suit asymptotiquement une loi du chi-deux sous H0. Son nombre de degrés de liberté est la différence entre les nombres de paramètres libres. Cette approximation transforme le rapport observé en règle de test ; elle n’affirme pas que l’une des hypothèses possède une probabilité égale à la vraisemblance calculée.
Un exemple, pas à pas
On observe 100 lancers indépendants d’une même pièce, dont 60 donnent face. L’hypothèse nulle H0 fixe la probabilité de face à 0,50. L’alternative laisse cette probabilité, notée p, varier entre 0 et 1. Le seuil du test est fixé à 5 %.
Étape 1. Sous l’alternative, la vraisemblance est maximale pour la proportion observée : p = 60/100 = 0,60. Sous H0, elle est évaluée en p = 0,50.
Étape 2. Le coefficient qui compte les ordres possibles des lancers est identique dans les deux vraisemblances et s’annule dans leur quotient. On obtient .
Étape 3. La statistique de Wilks vaut . L’alternative ajoute un seul paramètre libre, donc l’approximation utilise une loi du chi-deux à un degré de liberté.
Étape 4. Au seuil de 5 %, la valeur charnière de cette loi est environ 3,84. Comme 4,03 dépasse 3,84, le test rejette H0. La p-value asymptotique vaut environ 4,48 %.
Le contrôle consiste à inverser le quotient : Λ = 1/7,49 ≈ 0,134. Le calcul −2 log Λ redonne 4,03 ; les deux conventions conduisent donc à la même statistique lorsqu’on adapte le signe.
En pratique
Pour tester si un paramètre peut être fixé à une valeur précise, on ajuste d’abord le modèle contraint, puis le même modèle sans cette contrainte. Le rapport de leurs vraisemblances maximales isole ce que la liberté supplémentaire apporte aux données.
Pour comparer plusieurs paramètres à la fois, on compte combien de contraintes séparent les deux modèles. Cette différence détermine les degrés de liberté de l’approximation du chi-deux, à condition que les modèles soient emboîtés et réguliers.
Lorsque l’échantillon est petit ou qu’un paramètre se trouve au bord de son domaine, l’approximation de Wilks peut être inadéquate. On préfère alors soit une procédure exacte, qui utilise ou calcule la distribution nulle exacte, soit une calibration par simulation, qui estime cette distribution.
À ne pas confondre
Rapport de vraisemblance d’un test diagnostique. En notant Se la sensibilité et Sp la spécificité, le rapport positif vaut . Il compare la fréquence d’un résultat positif chez deux groupes ; il ne maximise pas deux modèles sur les mêmes données.
Facteur de Bayes. Il compare des probabilités marginales obtenues en intégrant les paramètres selon des lois a priori. Le rapport de vraisemblance généralisé utilisé dans cette fiche compare au contraire des maxima. Les deux coïncident donc rarement, même pour les mêmes hypothèses.
P-value. Elle mesure, sous H0, la probabilité d’une statistique au moins aussi extrême que celle observée. Dans l’exemple, R ≈ 7,49 est un quotient de vraisemblances, tandis que 4,48 % est la p-value asymptotique tirée de W.
Limites et pièges
Convention inversée. Avec alternative sur nulle, R ≥ 1 et la statistique est 2 log R. Avec nulle sur alternative, Λ ≤ 1 et elle est −2 log Λ. Employer le mauvais signe donnerait une valeur négative ; il faut annoncer le sens du quotient.
Égalité des ajustements. Le cas charnière R = 1 donne W = 0 : les paramètres supplémentaires n’améliorent pas la vraisemblance maximale. Un rapport proche de 1 ne soutient donc pas l’alternative, même s’il lui est légèrement supérieur.
Approximation asymptotique. La loi du chi-deux n’est pas une identité valable pour tout échantillon. Avec peu d’observations, un paramètre sur une frontière ou un paramètre non identifiable sous H0, la calibration peut être fausse ; il faut employer une loi exacte ou une simulation adaptée.
Modèles non emboîtés. Si aucun modèle n’est obtenu en contraignant les paramètres de l’autre, la différence de dimensions ne suffit pas à fixer une loi du chi-deux. Il faut choisir une méthode de comparaison conçue pour des modèles non emboîtés.
Pour aller plus loin
maximum de vraisemblance — Voir comment chaque modèle choisit le paramètre qui rend les données observées les plus vraisemblables.
Test d'hypothèse — Replacer le rapport, la statistique de test, le seuil et la décision dans une procédure complète.
Sensibilité — Approfondir le premier ingrédient du rapport de vraisemblance positif utilisé pour un test diagnostique.
Spécificité — Relier les résultats négatifs au second ingrédient des rapports de vraisemblance diagnostiques.
Explorez les mathématiques autrement
Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.
Découvrir les offres
