Una strada nella nebbia — e due modi di vederla

Immaginate una strada di montagna, di notte. La nebbia si infittisce. Un conducente umano socchiude gli occhi, regola lo sguardo e continua a distinguere le luci posteriori del veicolo che lo precede. Un sistema di intelligenza artificiale per la guida autonoma, invece, può letteralmente perdere di vista la strada. Non perché gli manchino dati o potenza di calcolo, ma perché gli manca qualcosa di più fondamentale: un meccanismo che il cervello umano ha perfezionato nel corso di milioni di anni di evoluzione.
Da qui prende avvio una ricerca condotta all’Università di Valencia da Pablo Hernández Cámara e dal suo gruppo. L’idea è semplice: invece di addestrare un’IA su milioni di immagini di nebbia, pioggia e notte — una rincorsa senza fine —, importare direttamente nella rete artificiale il meccanismo biologico che rende il cervello umano così robusto. Il risultato, pubblicato su Neurocomputing, supera il 20% di miglioramento in condizioni avverse. Per capire perché, però, bisogna prima entrare nella meccanica dello sguardo.

Il problema delle IA che vedono fin troppo bene con il bel tempo

I moderni sistemi di visione artificiale — quelli che consentono a un’auto autonoma di riconoscere un pedone, un segnale stradale o un semaforo rosso — sono reti neurali profonde. In parole semplici, pile di strati matematici che imparano ad associare schemi visivi a categorie. Addestrati su migliaia di immagini ben illuminate, diventano straordinariamente precisi. Con il bel tempo, un sistema simile può superare l’occhio umano.
Il problema è che questa precisione è fragile. Quando la luminosità diminuisce, quando un velo di nebbia attenua i contrasti, quando la pioggia crea riflessi indesiderati, i valori numerici che la rete ha imparato a riconoscere cambiano bruscamente. La rete non vede più ciò che ha imparato a vedere. Non si adatta: sbaglia. Un conducente umano, invece, non ha questo problema. Perché?

Il «controllo del volume» della corteccia visiva

La risposta sta in due parole: normalizzazione divisiva. Questo meccanismo, descritto come una computazione neuronale canonica dai neuroscienziati Matteo Carandini e David J. Heeger in una rassegna pubblicata su Nature Reviews Neuroscience, è presente in molti sistemi sensoriali. Il suo principio è di un’eleganza disarmante.
Nella corteccia visiva, ogni neurone non lavora da solo. La sua risposta viene continuamente rapportata all’attività dei neuroni vicini. In termini matematici, significa dividere il segnale di un neurone per una somma pesata dei segnali circostanti. Il numeratore è ciò che il neurone vede localmente. Il denominatore è il contesto circostante. Risultato: se l’area circostante è buia, il neurone amplifica il proprio segnale per far risaltare i dettagli. Se l’ambiente è molto luminoso, lo attenua per non saturare. È esattamente un controllo automatico del volume — quello che Hernández Cámara descrive così: «il cervello abbassa il volume per evitare di essere abbagliato».
Questo meccanismo non è una curiosità da laboratorio. Come mostrò il neuroscienziato David J. Heeger già all’inizio degli anni Novanta — in un articolo fondamentale sulla corteccia striata del gatto, oggi citato dal NASA Technical Reports Server —, le cellule visive si inibiscono a vicenda per normalizzare le proprie risposte rispetto al contrasto dello stimolo. Non è un dettaglio fisiologico: è il meccanismo che consente al sistema visivo di funzionare su più decadi di luminanza, dal chiaro di luna alla luce solare diretta.
Le reti neurali artificiali, invece, hanno progressivamente abbandonato questa ispirazione biologica a favore della velocità e della precisione in condizioni ideali. Un guadagno a breve termine, una fragilità a lungo termine.

Innesto del meccanismo biologico in una rete artificiale

Il gruppo valenciano ha quindi percorso la strada opposta. Ha preso architetture di reti neurali profonde comunemente usate per la segmentazione semantica — ossia il compito di etichettare ogni pixel di un’immagine («auto», «strada», «pedone») — e vi ha aggiunto strati che simulano la normalizzazione divisiva. In concreto, i neuroni artificiali sono costretti a comunicare con quelli vicini e a regolare le proprie attivazioni in funzione del contesto locale. Esattamente come fanno i neuroni biologici.
Per verificare la robustezza del sistema, i ricercatori hanno sottoposto le due versioni — classica e bioispirata — a una batteria di prove. Banche dati di guida reale in città europee, immagini di guida notturna in Svizzera e simulatori di guida virtuale. Le perturbazioni applicate alle immagini coprivano sistematicamente diverse dimensioni visive: luminanza, contrasto acromatico, contrasto cromatico, variazioni dell’illuminazione spettrale. Questi set di dati, fra cui gli insiemi IPL-Cityscapes-LuminanceContrasts e IPL-CARLA-dataset, sono accessibili pubblicamente su Hugging Face, permettendo ad altri gruppi di riprodurre e ampliare gli esperimenti.
La logica sperimentale è matematicamente rigorosa: si fissano le condizioni di addestramento, si fa variare in modo controllato una dimensione visiva e si misura la stabilità dell’output. Se il modello è davvero robusto, la sua segmentazione non deve crollare quando la luminanza si dimezza. È proprio ciò che misura lo studio — e ciò in cui il modello bioispirato riesce là dove quello classico fallisce.

Oltre il 20% di scarto — e una spiegazione convincente

I risultati sono netti. In condizioni normali, i due sistemi si equivalgono. Ma non appena la nebbia si infittisce o cala la notte, il divario si amplia: il sistema bioispirato mostra prestazioni superiori di oltre il 20% rispetto al suo omologo classico, secondo i risultati pubblicati su Neurocomputing. E non è una scatola nera a produrre questo risultato per caso: i ricercatori hanno analizzato le rappresentazioni interne della rete e verificato che essa amplificava davvero i dettagli dei veicoli nascosti nella foschia, là dove il modello standard li lasciava svanire.
Vale la pena soffermarsi su questo punto. Nell’apprendimento automatico, capita spesso di ottenere un guadagno prestazionale senza capirne il motivo. Qui il guadagno è spiegato da due meccanismi misurabili: una maggiore invarianza delle rappresentazioni interne alle perturbazioni e una non linearità adattiva che dipende dall’attività locale. È proprio ciò che Carandini e Heeger avevano previsto per i sistemi biologici. Il cerchio si chiude.
Per Hernández Cámara, la lezione va oltre la guida autonoma: «La natura ha già risolto alcuni dei problemi che l’intelligenza artificiale affronta oggi. Basta imparare da essa». Non è un argomento contro la potenza di calcolo, ma a favore della struttura. Talvolta la giusta operazione matematica vale più di un miliardo di esempi aggiuntivi.

Concetti chiave

  • Il cervello usa continuamente un «controllo del volume» automatico per vedere nella nebbia o di notte: ogni neurone visivo divide il proprio segnale per l’attività dei neuroni vicini, così da adattarsi al contesto. Le IA per la guida autonoma avevano abbandonato questo meccanismo — ed è per questo che diventano «cieche» non appena il tempo peggiora.
  • Aggiungere questo meccanismo biologico a una rete neurale artificiale ne migliora le prestazioni di oltre il 20% in condizioni di nebbia o oscurità, senza fornire più dati né maggiore potenza di calcolo.
  • Questo meccanismo — la normalizzazione divisiva — è noto ai neuroscienziati dagli anni Novanta. Si è dovuto attendere il 2025 perché alcuni ricercatori lo integrassero seriamente nelle reti di visione per auto autonome.
  • La robustezza di un’IA non si misura soltanto dalla sua precisione con il bel tempo: si misura dalla stabilità delle sue rappresentazioni interne quando le condizioni cambiano. È una questione matematica quanto una questione di sicurezza.

La divisione che stabilizza tutto: che cosa fa davvero la normalizzazione divisiva

Per addentrarci un po’ di più nel meccanismo, ecco che cosa fa concretamente questa operazione in una rete neurale.
Sia ri la risposta grezza di un neurone (o di un filtro, in una rete artificiale) a uno stimolo locale. Senza normalizzazione, questo valore viene trasmesso tale e quale allo strato successivo. Con la normalizzazione divisiva, la risposta effettiva diventa:
ŷi = rin / (σn + Σj wij · rjn)
dove la somma al denominatore si estende a un vicinato di neuroni j, pesati da coefficienti wij, e σ è un parametro di soglia che evita la divisione per zero. L’esponente n (spesso uguale a 2) introduce una non linearità che rende il meccanismo sensibile ai livelli di attività locale.
L’effetto geometrico di questa formula è interessante. Senza normalizzazione, le attivazioni di una rete di visione sono fortemente correlate: se aumenta la luminanza globale, tutti i neuroni rispondono più intensamente insieme. Con la normalizzazione, ogni risposta viene contestualizzata dalle risposte vicine — e questo tende a rendere le componenti del segnale più indipendenti dal punto di vista statistico. I neuroscienziati computazionali Odelia Schwartz ed Eero P. Simoncelli hanno mostrato, in un articolo pubblicato su Nature Neuroscience, che «le risposte risultanti sono significativamente più indipendenti» — il che corrisponde a una riduzione della ridondanza nella rappresentazione.
Per la guida autonoma, la conseguenza è diretta: quando la luminanza globale diminuisce (notte, nebbia), diminuisce anche il denominatore e le risposte dei neuroni restano in un intervallo utilizzabile. La rete non «vede» meno: ricalibra automaticamente la propria scala di riferimento. È questa proprietà di invarianza misurabile, quantificata nello studio di Neurocomputing sugli insiemi IPL-Cityscapes-LuminanceContrasts, a spiegare i guadagni osservati nelle condizioni estreme.
In fondo, ciò che questa ricerca mette in luce è che le reti neurali profonde non sono cervelli — ma possono prendere in prestito dalla biologia operazioni matematiche precise, i cui effetti sono misurabili e interpretabili. Non una metafora. Un’equazione.