La modelización de un texto pasa por la «vectorización»: un texto se considera una sucesión de palabras, y cada sucesión de palabras se representa mediante un vector en el espacio de todo el vocabulario utilizable. El algoritmo GPT consiste «simplemente» en predecir la palabra
n+1 conocidas las palabras de la 1 a la
n. Para ello, podrían utilizarse modelos muy clásicos, como las cadenas de Markov, que modelizan el paso de un estado a otro (véase
Tangente SUP 69, 2013). Pero GPT logra generar contenidos de muy buena calidad mejorando estos algoritmos elementales mediante algunas técnicas. En primer lugar, la enorme cantidad de datos utilizada permite parametrizar mejor las redes neuronales:
GPT-3 se entrenó con 570 Go de textos y cuenta con 175 000 millones de parámetros. Además, Chat-GPT incorpora una función de aprendizaje por refuerzo: los textos producidos son evaluados por personas, que señalan los «mejores», lo que permite favorecer los parámetros que condujeron a esos textos. Por último, Chat-GPT utiliza una arquitectura particular de redes neuronales: los transformadores.