Comme son nom l’indique, le Big Data concerne d’énormes quantités de données. A priori, ces données massives sont passives. Sans algorithme de traitement, elles n’apportent rien. Concrètement, comment ça marche ?
Suivre une épidémie de grippe =============================
En 2009, à partir du nombre de requêtes concernant les symptômes de la grippe (« fièvre », « courbatures », « grippe »…) dans un endroit donné, et de leur évolution dans le temps comme dans l’espace, Google a pensé pouvoir prédire l’évolution d’une épidémie de grippe et lancé l’outil Google Flu Trends. Elle l'a retiré quelques années plus tard car les prévisions de Google se sont révélées fausses dans 90 % des cas ! Les raisons sont multiples. Déjà, bien des gens confondent rhume et grippe, ce qui fausse leurs requêtes. D’autre part, ce n’est pas la distance géographique qui compte, mais la distance en temps de transport. Ainsi, Paris est plus proche de Nice que ne l’est Digne, car Nice et Paris sont reliées par avion, Nice et Digne seulement par le train des Pignes et par la route. En résumé, Google a démontré, sans le vouloir, qu’aussi massives soient-elles, des données ne sont rien si elles ne sont pas choisies et exploitées par un algorithme pertinent. Il semble qu’il faille pour le moins corréler les données des requêtes sur les moteurs de recherche avec des statistiques réelles des cas constatés à un moment donné.
Classer les pages du Web ========================
Si Google s’est fourvoyée pour prédire la grippe, son classement des pages sur Internet est performant. Le géant américain utilise la notion mathématique de chaîne de Markov et les données des clics d’une page à l’autre du Web. Pour comprendre comment ils opèrent, le mieux est de se représenter la Toile comme un graphe gigantesque dont les nœuds sont les pages, que nous relions quand l’une pointe sur une autre, c’est-à-dire qu’on peut y accéder en un clic de souris. Ce graphe est immense : il réunit plusieurs milliards de pages. L’essentiel de ces pages (90 %) sont connectées entre elles, dans un sens, dans l’autre ou les deux. Google utilise le graphe du Web pour fournir les pages traitant d’un sujet donné, en les classant selon leur degré de pertinence. Ce classement est dû aux internautes eux-mêmes, qui font pointer (ou non) leurs pages vers telle ou telle autre. Chaque page a ainsi un score selon le nombre de pages pointant vers elle, score qu’elle distribue à celles sur lesquelles elles pointent. Pour préciser les calculs, imaginons la partie du Web traitant du sujet cherché limitée à quatre pages, notées A, B, C et D.