Una pallina a 150 km/h, un robot e meno di un millisecondo per decidere
Immaginate un avversario che non sbatte mai le palpebre, non sente mai la pressione e ha imparato a giocare a ping-pong non guardando tutorial, bensì fallendo milioni di volte in un simulatore virtuale prima di trovarsi di fronte a un vero campione. Questo è esattamente Ace, un robot autonomo sviluppato da ricercatori, i cui risultati sono appena stati pubblicati sulla rivista Nature. Ace non è un gadget da fiera: affronta giocatori umani di livello agonistico — e regge il confronto.
Ma al di là dell’impresa sportiva, ciò che rende Ace affascinante è l’apparato matematico che opera dietro le quinte. Per capire perché questo robot rappresenti una svolta, bisogna addentrarsi in un ramo dell’intelligenza artificiale che somiglia stranamente al modo in cui impariamo noi stessi: l’apprendimento per rinforzo.
Imparare come un bambino — ma molto più in fretta
L’apprendimento per rinforzo, o reinforcement learning in inglese, è un metodo di apprendimento automatico nel quale un agente — qui il robot — impara a comportarsi interagendo con il proprio ambiente. Non c’è un insegnante che gli mostri i gesti giusti. C’è semplicemente una regola: alcune azioni fanno guadagnare punti (una ricompensa), altre ne fanno perdere. L’agente esplora, sbaglia, corregge e ricomincia — finché non trova la strategia che massimizza i suoi guadagni nel lungo periodo.
È proprio così che un bambino impara a camminare: non leggendo un manuale di biomeccanica, ma cadendo, rialzandosi e assimilando gradualmente ciò che funziona. La differenza è che Ace ha potuto compiere questo apprendimento milioni di volte in simulazione, a una velocità impossibile per un essere umano in carne e ossa.
Il mondo come una sequenza di decisioni
Perché un algoritmo possa imparare in questo modo, occorre fornirgli un quadro matematico. Quello usato da Ace — e dalla quasi totalità dei moderni sistemi di apprendimento per rinforzo — si chiama processo decisionale di Markov, o PDM. Il nome può intimorire, ma l’idea è semplice.
Un PDM suddivide il mondo in una serie di istanti. A ogni istante, l’agente osserva lo stato del mondo (dov’è la pallina? a quale velocità? in quale direzione?), sceglie un’azione (come orientare la racchetta, con quale forza colpire) e riceve in cambio una ricompensa (ha rimandato la pallina sul tavolo?). Lo stato successivo dipende soltanto dallo stato presente e dall’azione scelta — non dall’intera storia precedente. Questa è la proprietà di Markov: il passato non conta, per prevedere il futuro conta soltanto il presente.
«L’agente non deve ricordare tutti gli scambi precedenti. Gli basta sapere a che punto si trova ora per prendere la migliore decisione possibile.»
—
Questa semplificazione è al tempo stesso un’ipotesi forte e la chiave che rende il problema risolvibile matematicamente. Nel ping-pong, lo stato del mondo cambia centinaia di volte al secondo — da qui la necessità di tempi di reazione inferiori al millisecondo.
Gli occhi di Ace: una telecamera che non filma
Prima ancora di decidere che cosa fare, bisogna vedere. Ed è qui che Ace innova sul piano dell’hardware. Le telecamere tradizionali acquisiscono immagini a intervalli regolari — 30, 60, talvolta 240 volte al secondo. È molto, ma non basta affatto per seguire una pallina da ping-pong lanciata a tutta velocità.
Ace usa una telecamera a eventi. Invece di fotografare l’intera scena a intervalli fissi, questo tipo di sensore segnala soltanto i pixel la cui luminosità cambia — e lo fa con una risoluzione temporale dell’ordine del microsecondo (un milionesimo di secondo). Il risultato è un flusso di informazioni ultrarapido, poco rumoroso e perfettamente adatto agli oggetti in rapido movimento. È un po’ come se, anziché guardare un film fotogramma per fotogramma, percepiste soltanto ciò che si muove nella scena — e all’istante.
Questa percezione viene poi integrata con gli algoritmi decisionali per produrre una reazione motoria in tempi record. Percezione e azione non sono più due fasi separate: formano un ciclo continuo.
La politica del robot: imparare a scegliere
Nel cuore del sistema c’è quella che i ricercatori chiamano una politica (in inglese, policy): una funzione matematica che, a partire da uno stato osservato, indica quale azione compiere. L’obiettivo dell’apprendimento per rinforzo è proprio ottimizzare questa politica — trovare quella che massimizza la ricompensa cumulata nell’arco di uno scambio, se non addirittura di una partita.
Per affinare questa politica, gli algoritmi moderni usano tecniche di policy gradient — letteralmente, il «gradiente della politica». L’idea è calcolare in quale direzione modificare leggermente la politica affinché aumentino le ricompense future. È una forma di discesa del gradiente, lo stesso strumento matematico che permette alle reti neurali di imparare a riconoscere volti o a tradurre testi — applicato qui non a pixel statici, ma a sequenze di decisioni in un mondo fisico imprevedibile.
La sfida specifica del ping-pong è che l’ambiente è stocastico — cioè contiene una componente aleatoria irriducibile. La pallina può deviare leggermente a seconda dell’effetto impartito, l’avversario può variare il proprio gioco, le condizioni di gioco oscillano. L’algoritmo deve dunque apprendere una politica robusta, capace di adattarsi in tempo reale a queste variazioni.
Di fronte all’essere umano: la prova del nove
Addestrare un robot in simulazione è una cosa. Metterlo di fronte a veri giocatori umani è un’altra. I ricercatori hanno sottoposto Ace a partite contro giocatori di livello agonistico. I risultati, pubblicati su Nature, mostrano che Ace è in grado di sostenere scambi prolungati, adattare la propria tattica allo stile di gioco dell’avversario e piazzare colpi difficili da rimandare.
Non è soltanto un’impresa sportiva. È la dimostrazione che l’intelligenza artificiale incarnata — quella che agisce nel mondo fisico, con un corpo, sensori e vincoli di tempo reale — può raggiungere un livello di prestazione paragonabile a quello di esperti umani in compiti altamente dinamici. Un passo importante verso robot in grado di assistere gli esseri umani in ambienti complessi e imprevedibili: chirurgia, logistica, assistenza domiciliare.
Concetti da ricordare
- Un robot ha imparato a giocare a ping-pong contro campioni umani — non guardando video, ma fallendo milioni di volte in un simulatore, proprio come un bambino impara a camminare.
- La telecamera di Ace non filma: rileva soltanto i cambiamenti di luce, pixel per pixel, con una precisione di un milionesimo di secondo — e questo le permette di seguire una pallina a 150 km/h.
- In matematica, un «processo di Markov» significa che, per prendere la migliore decisione, basta conoscere la situazione presente — il passato non conta. È il principio su cui poggia l’intero cervello di Ace.
- L’apprendimento per rinforzo è l’arte di trovare la migliore strategia per tentativi ed errori in un mondo incerto — la stessa tecnica che permette alle IA di battere i migliori giocatori di scacchi o di Go.
- Questo robot non è soltanto un giocatore di ping-pong: dimostra che un’IA può agire nel mondo fisico in tempo reale, aprendo la strada ad applicazioni ben più serie dello sport.
Per gli appassionati di matematica
Un processo decisionale di Markov è definito formalmente da una quintupla (S, A, T, R, γ), dove S è lo spazio degli stati (la posizione e la velocità della pallina, la postura del robot…), A lo spazio delle azioni (i possibili movimenti della racchetta), T : S × A × S → [0,1] la funzione di transizione che dà la probabilità di passare da uno stato s a uno stato s' dopo l’azione a, R : S × A → ℝ la funzione di ricompensa e γ ∈ [0,1[ il fattore di sconto che pondera le ricompense future.
L’obiettivo è trovare una politica π : S → A (o una distribuzione su A) che massimizzi il valore atteso della ricompensa cumulata scontata: E[Σ γᵗ R(sₜ, aₜ)]. A tal fine, gli algoritmi di tipo policy gradient calcolano il gradiente di questo valore atteso rispetto ai parametri θ della politica πθ, poi aggiornano θ nella direzione di tale gradiente. Il teorema fondamentale del gradiente della politica (Sutton et al., 1999) stabilisce che questo gradiente vale: ∇θ J(θ) = E[∇θ log πθ(a|s) · Qπ(s,a)], dove Qπ(s,a) è la funzione valore-azione — il valore atteso della ricompensa cumulata partendo dallo stato s, scegliendo l’azione a e seguendo poi la politica π. È questa formula che permette ad Ace di adattare la propria strategia colpo dopo colpo, senza mai aver bisogno di un supervisore umano.