Per modellizzare un testo si ricorre alla «vettorializzazione»: un testo è considerato una successione di parole e ogni successione di parole è rappresentata da un vettore nello spazio dell’intero vocabolario utilizzabile. L’algoritmo GPT consiste «semplicemente» nel prevedere la parola
n+1 conoscendo le parole dalla 1 alla
n. A questo scopo si potrebbero usare modelli molto classici, come le catene di Markov, che modellizzano il passaggio da uno stato a un altro (vedi
Tangente SUP 69, 2013). Ma GPT riesce a generare contenuti di ottima qualità migliorando questi algoritmi elementari mediante alcune tecniche. Anzitutto, l’enorme quantità di dati utilizzati permette di calibrare meglio le reti neurali:
GPT-3 è stato addestrato su 570 Go di testi e conta 175 miliardi di parametri. Inoltre, Chat-GPT integra una funzione di apprendimento per rinforzo: i testi prodotti vengono valutati da esseri umani, che indicano i «migliori», favorendo così i parametri che hanno condotto a quei testi. Infine, Chat-GPT utilizza una particolare architettura di reti neurali: i trasformatori.