La modélisation d’un texte passe par la « vectorisation » : un texte est vu comme une suite de mots, et chaque suite de mots est représentée par un vecteur dans l’espace de tout le vocabulaire utilisable. L’algorithme GPT consiste « simplement » à prédire le mot
n+1 connaissant les mots 1 à
n. Pour cela, on pourrait utiliser des modèles très classiques, comme les chaînes de Markov, qui modélisent le passage d’un état à un autre (voir
Tangente SUP 69, 2013). Mais GPT parvient à générer des contenus de très bonne qualité en améliorant ces algorithmes élémentaires à l’aide de quelques techniques. D’abord, la très grande quantité de données utilisées permet un meilleur paramétrage des réseaux de neurones :
GPT-3 a été entraîné sur 570 Go de textes et compte 175 milliards de paramètres. Ensuite, Chat-GPT intègre une fonction d’apprentissage par renforcement : les textes produits sont évalués par des humains, et les « meilleurs » sont indiqués, ce qui permet de favoriser les paramètres ayant conduit à ces textes. Enfin, Chat-GPT utilise une architecture particulière de réseaux de neurones, les transformeurs.