Après des vacances bien méritées, j’aimerais trier automatiquement mes photos en deux classes : celles qui ont été prises sur la plage, et les autres. On peut imaginer une solution simple à ce problème. Étant donné une image d’entrée, je peux compter les pixels de couleur jaune. Dans le système RVB, où la couleur d’un pixel est caractérisée par les quantités de rouge, de vert, et de bleu qui la composent, on peut par exemple tester si les valeurs de rouge et de vert sont « suffisamment élevées », et la valeur de bleu « suffisamment faible ». On espère ainsi que les images qui contiennent suffisamment de pixels de couleur jaune seront les photos de la plage.
Comment définir « suffisamment » ? On choisit un seuil, et si le nombre de pixels jaunes dans une image lui est supérieur, on la classe comme « plage », sinon on la classe comme « autre ». Cela définit une fonction de décision. Si le seuil utilisé est trop élevé, tous les fichiers qui dépasseront le seuil seront effectivement des photos de plages (car « très jaunes »), mais on risque de rejeter à tort des images de plage contenant relativement peu de sable, et dont la quantité de jaune ne dépassera pas le seuil. Au contraire, si le seuil est trop bas, on tombera dans l’excès inverse, et la plupart des images seront classées comme « plage », y compris des photos qui appartiennent en réalité à la classe « autre ».
Un seuil et des pénalités
-------------------------
Plutôt que de choisir arbitrairement un tel seuil, on va se munir d’un ensemble d’entraînement en classifiant, manuellement, une cinquantaine de ces photos en deux catégories (« plage » et « autre »). Avec cet ensemble d’entraînement en main, on est maintenant en mesure d’associer, à chaque seuil, un taux d’erreur. En effet, étant donné un seuil, il devient possible d’effectuer le calcul du nombre de pixels jaune sur chacune des images de notre ensemble d’entraînement, et le comparer au seuil. Si la classification est correcte, on n’est pas pénalisé, sinon, on encourt une pénalité (normalisée à 1, disons). Le « meilleur » seuil sur cet ensemble d’entraînement sera alors celui qui nous donnera la pénalité moyenne la plus basse. En effet, si les photos de l’ensemble d’entraînement sont représentatives de l’album entier, on peut s’attendre à ce que la performance sur l’ensemble d’entraînement reflète la performance réelle (sur l’album entier) ; c’est ce qu’on appelle la généralisation.