Una pelota a 150 km/h, un robot y menos de un milisegundo para decidir
Imagine un adversario que nunca parpadea, nunca siente presión y que ha aprendido a jugar al tenis de mesa no viendo tutoriales, sino fallando millones de veces en un simulador virtual antes de enfrentarse a un auténtico campeón. Eso es exactamente Ace, un robot autónomo desarrollado por investigadores cuyos resultados acaban de publicarse en la revista Nature. Ace no es un artilugio de feria: se enfrenta a jugadores humanos de nivel competitivo y aguanta el ritmo.
Pero más allá de la hazaña deportiva, lo que hace fascinante a Ace es la maquinaria matemática que funciona bajo el capó. Para entender por qué este robot representa un avance decisivo, hay que adentrarse en una rama de la inteligencia artificial que se parece mucho a la forma en que aprendemos nosotros mismos: el aprendizaje por refuerzo.
Aprender como un niño, pero mucho más rápido
El aprendizaje por refuerzo, o reinforcement learning en inglés, es un método de aprendizaje automático en el que un agente —en este caso, el robot— aprende a comportarse interactuando con su entorno. No hay un profesor que le enseñe los gestos adecuados. Solo hay una regla: unas acciones dan puntos —una recompensa— y otras los restan. El agente explora, se equivoca, ajusta y vuelve a empezar, hasta encontrar la estrategia que maximiza sus ganancias a largo plazo.
Así es exactamente como un niño aprende a caminar: no leyendo un manual de biomecánica, sino cayéndose, levantándose e incorporando poco a poco lo que funciona. La diferencia es que Ace ha podido realizar este aprendizaje millones de veces en simulación, a una velocidad imposible para un ser humano de carne y hueso.
El mundo como una secuencia de decisiones
Para que un algoritmo pueda aprender de este modo, hay que proporcionarle un marco matemático. El que utiliza Ace —y casi todos los sistemas modernos de aprendizaje por refuerzo— se llama proceso de decisión de Markov, o PDM. El nombre puede asustar, pero la idea es sencilla.
Un PDM divide el mundo en una serie de instantes. En cada instante, el agente observa el estado del mundo (¿dónde está la pelota?, ¿a qué velocidad?, ¿en qué dirección?), elige una acción (cómo orientar la pala, con qué fuerza golpear) y recibe a cambio una recompensa (¿ha devuelto la pelota a la mesa?). El estado siguiente depende únicamente del estado presente y de la acción elegida, no de todo el historial. Esa es la propiedad de Markov: el pasado no importa; solo el presente cuenta para predecir el futuro.
«El agente no necesita recordar todos sus intercambios anteriores. Le basta con saber dónde se encuentra ahora para tomar la mejor decisión posible».
—
Esta simplificación es a la vez una hipótesis fuerte y la clave que hace el problema matemáticamente resoluble. En el tenis de mesa, el estado del mundo cambia cientos de veces por segundo, de ahí la necesidad de tiempos de reacción inferiores a un milisegundo.
Los ojos de Ace: una cámara que no graba
Antes incluso de decidir qué hacer, hay que ver. Y ahí es donde Ace innova en el plano técnico. Las cámaras convencionales capturan imágenes a intervalos regulares: 30, 60 y, a veces, 240 veces por segundo. Está bien, pero resulta claramente insuficiente para seguir una pelota de ping-pong lanzada a toda velocidad.
Ace utiliza una cámara basada en eventos. En vez de fotografiar toda la escena a intervalos fijos, este tipo de sensor solo señala los píxeles cuya luminosidad cambia, y lo hace con una resolución temporal del orden del microsegundo (una millonésima de segundo). El resultado es un flujo de información ultrarrápido, con muy poco ruido y perfectamente adaptado a los objetos que se mueven con rapidez. Es un poco como si, en vez de ver una película fotograma a fotograma, solo percibiera de forma instantánea lo que se mueve en la escena.
Esta percepción se fusiona después con los algoritmos de decisión para producir una respuesta motora en un tiempo récord. La percepción y la acción ya no son dos etapas separadas: forman un bucle continuo.
La política del robot: aprender a elegir
En el corazón del sistema está lo que los investigadores llaman una política (en inglés, policy): una función matemática que, a partir de un estado observado, indica qué acción ejecutar. El objetivo del aprendizaje por refuerzo es precisamente optimizar esta política: encontrar la que maximiza la recompensa acumulada a lo largo de un intercambio, o incluso de un partido.
Para perfeccionar esta política, los algoritmos modernos emplean técnicas denominadas policy gradient, literalmente, el «gradiente de la política». La idea consiste en calcular en qué dirección hay que modificar ligeramente la política para aumentar las recompensas futuras. Es una forma de descenso de gradiente, la misma herramienta matemática que permite a las redes neuronales aprender a reconocer rostros o a traducir textos, aplicada aquí no a píxeles estáticos, sino a secuencias de decisiones en un mundo físico imprevisible.
El reto particular del tenis de mesa es que el entorno es estocástico, es decir, contiene una parte irreductible de azar. La pelota puede desviarse ligeramente según el efecto que lleve, el adversario puede variar su juego y las condiciones de juego fluctúan. Por tanto, el algoritmo debe aprender una política robusta, capaz de adaptarse en tiempo real a esas variaciones.
Frente al ser humano: la prueba de fuego
Entrenar a un robot en simulación es una cosa; enfrentarlo a jugadores humanos reales es otra. Los investigadores sometieron a Ace a partidos contra jugadores de nivel competitivo. Los resultados, publicados en Nature, muestran que Ace es capaz de mantener intercambios prolongados, adaptar su táctica al estilo de juego del adversario y colocar golpes difíciles de devolver.
No es solo una proeza deportiva. Es la demostración de que la inteligencia artificial encarnada —la que actúa en el mundo físico, con un cuerpo, sensores y limitaciones de tiempo real— puede alcanzar un nivel de rendimiento comparable al de expertos humanos en tareas muy dinámicas. Un paso importante hacia robots capaces de asistir a los seres humanos en entornos complejos e imprevisibles: cirugía, logística y asistencia domiciliaria.
Conceptos clave
- Un robot ha aprendido a jugar al ping-pong contra campeones humanos, no viendo vídeos, sino fallando millones de veces en un simulador, exactamente como un niño aprende a caminar.
- La cámara de Ace no graba: detecta únicamente los cambios de luz, píxel a píxel, con una precisión de una millonésima de segundo, lo que le permite seguir una pelota a 150 km/h.
- En matemáticas, un «proceso de Markov» significa que, para tomar la mejor decisión, basta con conocer la situación presente: el pasado no cuenta. Es el principio en el que se basa todo el cerebro de Ace.
- El aprendizaje por refuerzo es el arte de encontrar la mejor estrategia por ensayo y error en un mundo incierto: la misma técnica que permite a las IA vencer a los mejores jugadores de ajedrez o de Go.
- Este robot no es solo un jugador de ping-pong: demuestra que una IA puede actuar en el mundo físico en tiempo real, abriendo la puerta a aplicaciones mucho más serias que el deporte.
Para los amantes de las matemáticas
Un proceso de decisión de Markov se define formalmente mediante una quíntupla (S, A, T, R, γ), donde S es el espacio de estados (la posición y la velocidad de la pelota, la postura del robot…), A el espacio de acciones (los posibles movimientos de la pala), T : S × A × S → [0,1] la función de transición que da la probabilidad de pasar de un estado s a un estado s' tras la acción a, R : S × A → ℝ la función de recompensa y γ ∈ [0,1[ el factor de descuento que pondera las recompensas futuras.
El objetivo es encontrar una política π : S → A (o una distribución sobre A) que maximice la esperanza de la recompensa acumulada descontada: E[Σ γᵗ R(sₜ, aₜ)]. Para ello, los algoritmos de tipo policy gradient calculan el gradiente de esta esperanza respecto de los parámetros θ de la política πθ y, a continuación, actualizan θ en la dirección de ese gradiente. El teorema fundamental del gradiente de política (Sutton et al., 1999) establece que dicho gradiente es: ∇θ J(θ) = E[∇θ log πθ(a|s) · Qπ(s,a)], donde Qπ(s,a) es la función de valor de acción, la esperanza de recompensa acumulada partiendo del estado s, eligiendo la acción a y siguiendo después la política π. Esta fórmula permite a Ace ajustar su estrategia golpe a golpe, sin necesitar nunca un supervisor humano.