Una carretera entre la niebla: dos formas de verla

Imagine una carretera de montaña, de noche. La niebla se espesa. Un conductor humano entrecierra los ojos, ajusta la mirada y sigue distinguiendo las luces traseras del vehículo que le precede. Un sistema de inteligencia artificial para conducción autónoma, en cambio, puede perder literalmente de vista la carretera. No porque le falten datos o potencia de cálculo, sino porque carece de algo más fundamental: un mecanismo que el cerebro humano ha perfeccionado a lo largo de millones de años de evolución.
Este es el punto de partida de una investigación realizada en la Universidad de Valencia por Pablo Hernández Cámara y su equipo. Su idea: en vez de entrenar una IA con millones de imágenes de niebla, lluvia y noche —una carrera sin fin—, incorporar directamente a la red artificial el mecanismo biológico que hace tan robusto al cerebro humano. El resultado, publicado en Neurocomputing, supera el 20 % de mejora en condiciones adversas. Pero, para entender por qué, primero hay que adentrarse en la mecánica de la mirada.

El problema de las IA que ven demasiado bien con buen tiempo

Los sistemas modernos de visión artificial —los que permiten a un coche autónomo reconocer a un peatón, una señal o un semáforo en rojo— son redes neuronales profundas. En otras palabras: apilamientos de capas matemáticas que aprenden a asociar patrones visuales con categorías. Entrenados con miles de imágenes bien iluminadas, se vuelven tremendamente precisos. Con buen tiempo, uno de estos sistemas puede superar al ojo humano.
El problema es que esa precisión es frágil. Cuando baja la luminosidad, cuando un velo de niebla atenúa los contrastes, cuando la lluvia crea reflejos parásitos, los valores numéricos que la red ha aprendido a reconocer cambian bruscamente. La red deja de ver lo que ha aprendido a ver. No se adapta: se equivoca. Un conductor humano, en cambio, no tiene ese problema. ¿Por qué?

El «control de volumen» de la corteza visual

La respuesta cabe en dos palabras: normalización divisiva. Este mecanismo, descrito como un cálculo neuronal canónico por los neurocientíficos Matteo Carandini y David J. Heeger en un artículo de síntesis publicado en Nature Reviews Neuroscience, está presente en numerosos sistemas sensoriales. Su principio es elegantemente sencillo.
En la corteza visual, cada neurona no trabaja sola. Su respuesta se compara constantemente con la actividad de sus vecinas. Matemáticamente, esto equivale a dividir la señal de una neurona por una suma ponderada de las señales circundantes. El numerador es lo que la neurona ve localmente. El denominador, el contexto. El resultado: si todo el entorno está oscuro, la neurona amplifica su señal para resaltar los detalles. Si todo deslumbra, la atenúa para no saturarse. Es exactamente un control de volumen automático, el que Hernández Cámara describe así: «el cerebro baja el volumen para evitar quedar deslumbrado».
Este mecanismo no es una curiosidad de laboratorio. Como mostró el neurocientífico David J. Heeger ya a comienzos de la década de 1990 —en un artículo fundacional sobre la corteza estriada del gato, hoy referenciado por el NASA Technical Reports Server—, las células visuales se inhiben mutuamente para normalizar sus respuestas con respecto al contraste del estímulo. No es un detalle fisiológico: es el mecanismo que permite al sistema visual funcionar a lo largo de varios órdenes de magnitud de luminancia, desde la luz de la luna hasta la luz solar directa.
Las redes neuronales artificiales, en cambio, han abandonado paulatinamente esta inspiración biológica en favor de la velocidad y la precisión en condiciones ideales. Ganancia a corto plazo, fragilidad a largo plazo.

Incorporar el mecanismo biológico a una red artificial

El equipo valenciano recorrió, por tanto, el camino inverso. Tomó arquitecturas de redes neuronales profundas de uso habitual para la segmentación semántica —es decir, la tarea de etiquetar cada píxel de una imagen («coche», «carretera», «peatón»)— y les añadió capas que simulan la normalización divisiva. En concreto, se obliga a las neuronas artificiales a comunicarse con sus vecinas y a ajustar sus activaciones en función del contexto local. Exactamente igual que las neuronas biológicas.
Para poner a prueba la robustez del sistema, los investigadores sometieron las dos versiones —la clásica y la bioinspirada— a una batería de pruebas: bases de datos de conducción real en ciudades europeas, imágenes de conducción nocturna en Suiza y simuladores de conducción virtual. Las perturbaciones aplicadas a las imágenes abarcaban sistemáticamente varias dimensiones visuales: luminancia, contraste acromático, contraste cromático y cambios en la iluminación espectral. Estos conjuntos de datos, entre ellos IPL-Cityscapes-LuminanceContrasts e IPL-CARLA-dataset, son accesibles públicamente en Hugging Face, lo que permite a otros equipos reproducir y ampliar los experimentos.
La lógica experimental es matemáticamente impecable: se fijan las condiciones de entrenamiento, se varía de forma controlada una dimensión visual y se mide la estabilidad de la salida. Si el modelo es realmente robusto, su segmentación no debe derrumbarse cuando la luminancia se reduce a la mitad. Eso es precisamente lo que mide el estudio, y lo que el modelo bioinspirado logra allí donde el clásico fracasa.

Más de un 20 % de diferencia, y una explicación sólida

Los resultados son claros. En condiciones normales, ambos sistemas rinden igual. Pero en cuanto la niebla se espesa o cae la noche, la diferencia aumenta: el sistema bioinspirado ofrece un rendimiento más de un 20 % superior al de su homólogo clásico, según los resultados publicados en Neurocomputing. Y no es una caja negra que produzca este resultado por accidente: los investigadores analizaron las representaciones internas de la red y comprobaron que amplificaba los detalles de los vehículos ocultos entre la niebla, allí donde el modelo estándar dejaba que desaparecieran.
Conviene detenerse en este punto. En aprendizaje automático es frecuente obtener una mejora de rendimiento sin entender por qué. Aquí, la mejora se explica mediante dos mecanismos medibles: una mayor invariancia de las representaciones internas ante las perturbaciones y una no linealidad adaptativa que depende de la actividad local. Es precisamente lo que Carandini y Heeger habían predicho para los sistemas biológicos. El círculo se cierra.
Para Hernández Cámara, la lección va más allá de la conducción autónoma: «La naturaleza ya ha resuelto algunos de los problemas a los que se enfrenta hoy la inteligencia artificial. Basta con aprender de ella». No es un alegato contra la potencia de cálculo, sino un argumento a favor de la estructura. A veces, la operación matemática adecuada vale más que mil millones de ejemplos adicionales.

Conceptos clave

  • Tu cerebro utiliza continuamente un «control de volumen» automático para ver con niebla o de noche: cada neurona visual divide su señal por la actividad de sus vecinas para adaptarse al contexto. Las IA de conducción autónoma habían abandonado este mecanismo, y por eso se vuelven «ciegas» en cuanto empeora el tiempo.
  • Añadir este mecanismo biológico a una red neuronal artificial mejora su rendimiento en más de un 20 % en condiciones de niebla u oscuridad, sin proporcionarle más datos ni más potencia de cálculo.
  • Este mecanismo —la normalización divisiva— es conocido por los neurocientíficos desde la década de 1990. Hubo que esperar hasta 2025 para que unos investigadores lo integraran seriamente en redes de visión para coches autónomos.
  • La robustez de una IA no se mide solo por su precisión con buen tiempo: se mide por la estabilidad de sus representaciones internas cuando cambian las condiciones. Es una cuestión matemática tanto como una cuestión de seguridad.

La división que lo estabiliza todo: qué hace realmente la normalización divisiva

Para profundizar un poco más en el mecanismo, veamos qué hace concretamente esta operación en una red neuronal.
Sea ri la respuesta bruta de una neurona —o de un filtro, en una red artificial— ante un estímulo local. Sin normalización, este valor se transmite tal cual a la capa siguiente. Con normalización divisiva, la respuesta efectiva pasa a ser:
ŷi = rin / (σn + Σj wij · rjn)
donde la suma del denominador recorre un vecindario de neuronas j, ponderadas por coeficientes wij, y σ es un parámetro umbral que evita la división por cero. El exponente n (a menudo igual a 2) introduce una no linealidad que hace que el mecanismo sea sensible a los niveles de actividad local.
Lo que produce esta fórmula resulta geométricamente interesante. Sin normalización, las activaciones de una red de visión están fuertemente correlacionadas entre sí: si aumenta la luminancia global, todas las neuronas responden conjuntamente con mayor intensidad. Con normalización, cada respuesta se contextualiza mediante sus vecinas, lo que tiende a volver estadísticamente más independientes los componentes de la señal. Los neurocientíficos computacionales Odelia Schwartz y Eero P. Simoncelli mostraron, en un artículo publicado en Nature Neuroscience, que «las respuestas resultantes son significativamente más independientes», lo que corresponde a una reducción de la redundancia en la representación.
En la conducción autónoma, esto se traduce directamente: cuando cae la luminancia global —de noche o con niebla—, el denominador también cae y las respuestas de las neuronas se mantienen dentro de un intervalo utilizable. La red no «ve» menos: recalibra automáticamente su escala de referencia. Esta propiedad de invariancia medible, cuantificada en el estudio de Neurocomputing con los conjuntos IPL-Cityscapes-LuminanceContrasts, explica las mejoras observadas en condiciones extremas.
En el fondo, lo que esta investigación pone de relieve es que las redes neuronales profundas no son cerebros, pero pueden tomar prestadas de la biología operaciones matemáticas precisas cuyos efectos son medibles e interpretables. No es una metáfora. Es una ecuación.