Probabilités et statistiquesReprésentation graphique · Glossaire
Courbe ROC
Quand on déplace le seuil d’un classifieur binaire, on détecte davantage de vrais cas, mais on risque aussi davantage de fausses alertes. La courbe ROC montre ce compromis : chaque seuil relie une sensibilité, en ordonnée, à un taux de faux positifs, en abscisse. Son aire, l’AUC, résume la capacité du score à séparer les deux classes ; les axes, son calcul et ses limites sont détaillés dans la fiche.
Sommaire
Ce que vous allez apprendre
- Relier chaque point ROC à un seuil, une sensibilité et un taux de faux positifs.
- Calculer un point ROC à partir de VP, FP, FN et VN.
- Interpréter une AUC de 0,5, de 1 ou une valeur intermédiaire sans en déduire automatiquement un seuil.
- Reconnaître les limites liées au déséquilibre des classes, aux courbes qui se croisent et aux petits échantillons.
En clair
Un modèle attribue un score à chaque dossier : plus le score est élevé, plus il penche vers la réponse « positive ». En déplaçant le seuil qui sépare les deux réponses, on détecte davantage de vrais cas, mais on risque aussi de déclencher davantage de fausses alertes.
La courbe ROC garde la trace de ce compromis. Chaque point représente un seuil. Une courbe proche du coin supérieur gauche associe beaucoup de détections à peu de fausses alertes. L’aire AUC résume cette capacité de séparation en un nombre.
Définition
Une courbe ROC évalue un score ou un classifieur binaire sur des observations dont la classe réelle, positive ou négative, est connue. Pour chaque seuil de décision, elle place en ordonnée le taux de vrais positifs, aussi appelé sensibilité, et en abscisse le taux de faux positifs, égal à 1 moins la spécificité.
Le nombre de vrais positifs est noté VP, celui des faux négatifs FN, celui des faux positifs FP et celui des vrais négatifs VN. Les deux coordonnées sont donc :
Ces rapports supposent la présence d’au moins une observation réellement positive et d’au moins une observation réellement négative. Le sens de parcours dépend de la convention du score ; ici, un score élevé indique la classe positive.
L’aire sous la courbe, notée AUC, varie de 0 à 1 pour une courbe ROC standard. Elle vaut 0,5 pour une discrimination aléatoire et 1 pour une séparation parfaite. Une valeur inférieure à 0,5 peut signaler que l’ordre du score est inversé. L’AUC compare la séparation globale des deux classes ; elle ne choisit pas à elle seule un seuil adapté à une décision concrète.
Où on le rencontre
On rencontre une courbe ROC dans le compte rendu d’un modèle de classification ou dans l’évaluation d’un test en épidémiologie. Le graphique est carré ou rectangulaire, avec deux axes gradués de 0 à 1. L’axe horizontal porte le taux de faux positifs et l’axe vertical la sensibilité.
Une diagonale reliant le coin inférieur gauche au coin supérieur droit sert souvent de repère pour le hasard. La courbe elle-même part de (0 ; 0), rejoint (1 ; 1) et peut former un escalier sur un échantillon fini. Des points ou des étiquettes de seuil peuvent accompagner le tracé. L’ensemble montre la réponse du classifieur lorsque sa règle de décision devient progressivement moins stricte.
Le mode d'emploi
La grandeur principale à lire est le couple formé par la sensibilité et le taux de faux positifs pour un seuil donné.
1. Repérez le seuil associé au point, puis lisez horizontalement son taux de faux positifs et verticalement sa sensibilité.
2. Comparez ce point au coin supérieur gauche, qui représente une sensibilité de 1 et aucun faux positif.
3. Examinez ensuite toute la courbe : un tracé durablement au-dessus de la diagonale traduit une discrimination meilleure que le hasard.
4. Utilisez enfin l’AUC pour résumer le classement global, sans lui faire choisir le seuil.
2. Comparez ce point au coin supérieur gauche, qui représente une sensibilité de 1 et aucun faux positif.
3. Examinez ensuite toute la courbe : un tracé durablement au-dessus de la diagonale traduit une discrimination meilleure que le hasard.
4. Utilisez enfin l’AUC pour résumer le classement global, sans lui faire choisir le seuil.
La convention des axes doit toujours être vérifiée : l’abscisse est normalement 1 − spécificité, et non la spécificité. Une courbe visuellement haute peut aussi masquer un taux de faux positifs trop coûteux dans le contexte étudié ; le bon réflexe consiste à lire les deux coordonnées du seuil retenu.
Le tracé en escalier de l’exemple matérialise chaque changement provoqué par le passage d’un dossier supplémentaire dans la classe prédite positive.
Un exemple, pas à pas
Un classifieur attribue un score à huit dossiers. Quatre sont réellement positifs et quatre réellement négatifs. Les scores décroissants et les classes réelles sont : 0,95 (positive), 0,85 (négative), 0,75 (positive), 0,65 (positive), 0,55 (négative), 0,45 (négative), 0,35 (positive) et 0,25 (négative). Un dossier est prédit positif si son score est au moins égal au seuil.
1. Au seuil 0,60, quatre dossiers sont prédits positifs : trois le sont réellement et un est négatif. On obtient donc VP = 3, FP = 1, FN = 1 et VN = 3.
2. La sensibilité vaut 3 ÷ (3 + 1) = 0,75. Le taux de faux positifs vaut 1 ÷ (1 + 3) = 0,25. Le seuil 0,60 donne donc le point (0,25 ; 0,75).
3. En abaissant successivement le seuil au niveau de chaque score, on obtient les points (0 ; 0), (0 ; 0,25), (0,25 ; 0,25), (0,25 ; 0,50), (0,25 ; 0,75), (0,50 ; 0,75), (0,75 ; 0,75), (0,75 ; 1) et (1 ; 1).
4. L’aire de cet escalier vaut 11/16 = 0,6875. Le contrôle se refait en comparant les seize couples formés d’un dossier positif et d’un dossier négatif : dans onze couples, le score positif est le plus élevé.
En pratique
En dépistage, on examine plusieurs seuils d’un score. Si manquer un cas est particulièrement grave, on privilégie une sensibilité élevée, tout en contrôlant le nombre de fausses alertes. Une analyse des coûts ou des conséquences complète alors la courbe ROC.
En apprentissage automatique, la courbe ROC compare des modèles qui produisent des scores sur le même jeu d’évaluation. L’AUC offre un résumé global ; si un seul seuil sera utilisé, les coordonnées à ce seuil restent plus informatives que l’aire seule.
Quand la classe positive est très rare, on complète souvent la ROC par une courbe précision-rappel. Le critère observable est la proportion de vrais positifs parmi les alertes : elle peut rester faible malgré un taux de faux positifs apparemment modeste.
À ne pas confondre
Courbe précision-rappel. Elle met en relation le rappel, identique à la sensibilité, et la précision parmi les prédictions positives. Sur un échantillon où les positifs sont rares, deux modèles proches en ROC peuvent afficher des précisions très différentes.
Courbe de calibration. Elle vérifie si un score annoncé comme une probabilité correspond aux fréquences observées. Un modèle peut bien classer les dossiers, donc avoir une bonne AUC, tout en donnant des probabilités mal calibrées.
Matrice de confusion. Elle décrit VP, FP, FN et VN pour un seuil fixé. La courbe ROC rassemble au contraire les taux obtenus pour tous les seuils ; le point à 0,60 dans l’exemple correspond à une seule matrice.
Limites et pièges
AUC de 0,5 ou de 1. Une AUC de 0,5 caractérise le niveau aléatoire, tandis qu’une AUC de 1 correspond à une séparation parfaite sur les données évaluées. Ce dernier résultat ne prouve pas que le modèle restera parfait sur de nouvelles données ; il faut l’évaluer sur un échantillon indépendant.
Classes très déséquilibrées. Un faible taux de faux positifs peut encore produire beaucoup de fausses alertes quand les négatifs sont très nombreux. Il faut alors consulter les effectifs, la précision et, si elle répond au besoin, la courbe précision-rappel.
Même AUC, décisions différentes. Deux courbes peuvent avoir la même aire et se croiser. Si la décision exige par exemple un taux de faux positifs inférieur à 0,10, il faut comparer les sensibilités dans cette zone plutôt que les seules AUC.
Petit échantillon ou scores ex æquo. La courbe devient grossière et l’AUC estimée peut être instable. Les ex æquo exigent une convention cohérente, et une estimation d’incertitude ou une validation répétée évite de surinterpréter un écart minime.
Pour aller plus loin
Sensibilité. Approfondir le taux placé sur l’axe vertical et son lien avec les vrais positifs et les faux négatifs.
Spécificité. Relier le taux de vrais négatifs à l’abscisse ROC, qui utilise son complément 1 − spécificité.
Explorez les mathématiques autrement
Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.
Découvrir les offres
