Come indica il nome stesso, i Big Data riguardano enormi quantità di dati. A priori, questi dati massivi sono passivi. Senza un algoritmo di elaborazione, non servono a nulla. In concreto, come funziona?
Seguire un’epidemia influenzale =============================
Nel 2009, a partire dal numero di ricerche relative ai sintomi dell’influenza («febbre», «dolori muscolari», «influenza»…) in una data zona, e dalla loro evoluzione nel tempo e nello spazio, Google pensò di poter prevedere l’evoluzione di un’epidemia influenzale e lanciò lo strumento Google Flu Trends. Lo ritirò qualche anno dopo, poiché le previsioni di Google si rivelarono errate nel 90% dei casi! Le ragioni sono molteplici. Anzitutto, molte persone confondono raffreddore e influenza, falsando così le loro ricerche. D’altra parte, ciò che conta non è la distanza geografica, bensì il tempo di percorrenza. Così, Parigi è più vicina a Nizza di quanto lo sia Digne, perché Nizza e Parigi sono collegate in aereo, mentre Nizza e Digne soltanto dal treno delle Pignes e dalla strada. In sintesi, Google dimostrò involontariamente che, per quanto massivi siano, i dati non valgono nulla se non vengono scelti e sfruttati da un algoritmo pertinente. Sembra che occorra perlomeno correlare i dati delle ricerche sui motori di ricerca con statistiche reali dei casi rilevati in un dato momento.
Classificare le pagine del Web ========================
Se Google ha sbagliato nel prevedere l’influenza, la sua classificazione delle pagine su Internet è efficace. Il colosso americano utilizza la nozione matematica di catena di Markov e i dati relativi ai clic da una pagina all’altra del Web. Per capire come funziona, è utile rappresentarsi la Rete come un grafo gigantesco i cui nodi sono le pagine, collegate quando una rimanda a un’altra, cioè quando vi si può accedere con un clic del mouse. Questo grafo è immenso: riunisce parecchi miliardi di pagine. La maggior parte di queste pagine (il 90%) è collegata alle altre, in un senso, nell’altro o in entrambi. Google utilizza il grafo del Web per fornire le pagine che trattano un determinato argomento, classificandole secondo il loro grado di pertinenza. Questa classificazione è dovuta agli stessi internauti, che fanno puntare, oppure no, le loro pagine verso una pagina o un’altra. Ogni pagina ha così un punteggio in base al numero di pagine che rimandano a essa, punteggio che distribuisce alle pagine verso cui rimanda. Per precisare i calcoli, immaginiamo che la parte del Web relativa all’argomento cercato sia limitata a quattro pagine, indicate con A, B, C e D.