Imaginez un étudiant qui sort d'un examen en annonçant 377 bonnes réponses. On applaudit. Puis on apprend que le sujet comptait environ 4 000 questions. Les applaudissements deviennent plus mesurés, sans cesser tout à fait, car certaines de ces questions n'avaient jamais trouvé de réponse, chez personne, nulle part.
C'est, en raccourci, l'histoire de l'annonce faite par OpenAI le 6 octobre 2026. Un modèle d'intelligence artificielle aurait résolu 377 questions mathématiques ouvertes, et la communauté des chercheurs se débat avec la manière d'accueillir ces résultats. Un « problème ouvert » est une question précise, formulée par des mathématiciens, dont personne n'a encore démontré la réponse. La démonstration, ou preuve, est une chaîne d'arguments qui ne laisse aucune place au doute. Pour un jeune qui envisage une thèse, la question qui suit vient vite : reste-t-il quelque chose à faire ?
Pour y répondre, il faut regarder les chiffres de près. Et surtout celui qu'on ne met jamais en titre.
Le dénominateur, ce grand oublié
Selon Quanta Magazine, le modèle, qualifié de nouveau, interne et anonyme, s'est attaqué à environ 4 000 problèmes et a échoué sur la grande majorité d'entre eux. Faites la division : 377 sur 4 000, cela fait environ 9,4 %. À peu près une tentative sur dix aboutit. Ce chiffre se lit de deux façons. Côté verre à moitié vide, la machine échoue neuf fois sur dix. Côté verre à moitié plein, aucun laboratoire humain n'aurait seulement essayé 4 000 problèmes ouverts en une campagne, et une réussite sur dix sur des questions restées sans réponse n'est pas rien. Les deux lectures sont arithmétiquement exactes. Ce qui manque, c'est une troisième information : qui a choisi les 4 000 problèmes, et selon quels critères ? Si l'échantillon penche vers des questions de difficulté modeste, ce qu'on appelle un biais de sélection, les 9,4 % ne disent pas la même chose que s'il s'agissait d'un tirage au hasard parmi les grandes conjectures.
La moisson couvre en tout cas un territoire large. Le New York Times cite l'algèbre, la théorie des nombres, l'informatique théorique, la logique mathématique et la topologie. D'après Quanta, les résultats sont répartis dans 722 articles déposés sur GitHub, une plateforme publique d'hébergement de fichiers très utilisée par les programmeurs. Ce sont 722 manuscrits, pas 722 articles publiés dans des revues. Trois heures de machine, des décennies de relecture
Le magazine Fortune apporte deux précisions. D'abord, le modèle aurait demandé en moyenne environ trois heures de calcul par solution. Ensuite, il s'agit de solutions « complètes ou partielles ». La proportion entre les deux n'est pas détaillée. Faisons le calcul. 377 solutions à trois heures pièce, cela donne environ 1 100 heures, soit un peu plus d'un mois et demi de calcul continu. Ce total ne tient vraisemblablement pas compte des 3 600 tentatives ratées. Face à cela, mettez le temps humain. En mathématiques, un résultat n'est pas accepté parce qu'il est écrit. Il l'est quand des spécialistes l'ont relu ligne à ligne : c'est la relecture par les pairs. Faisons une hypothèse d'école, prudente et invérifiable dans le détail : un relecteur attentif consacre un mois à chaque manuscrit. Les 722 articles représenteraient alors 722 mois de travail, environ soixante ans pour une seule personne.
La production est devenue bon marché. La vérification, elle, ne l'est pas.
Ce déséquilibre est le vrai sujet. L'économie des mathématiques a toujours supposé qu'écrire une preuve coûtait au moins autant que la relire. Ici, l'ordre des coûts s'inverse, et c'est le temps des relecteurs, pas celui des machines, qui devient la ressource rare.
Dix explications pour 377 boîtes noires
Un deuxième chiffre pique. Selon le New York Times, OpenAI n'a fourni des résumés de la démarche suivie par le modèle que pour 10 des résultats. Dix sur 377, soit moins de 3 %. Le quotidien rappelle aussi que le modèle reste inaccessible au public et qu'il s'agit du même système que celui invoqué lors d'une annonce antérieure sur les équations de Navier–Stokes, qui décrivent l'écoulement des fluides.
Vous voyez le problème ? En science, on appelle reproductibilité la possibilité, pour d'autres équipes, de refaire l'expérience et d'obtenir le même résultat. Une preuve mathématique a l'avantage de se vérifier sur le papier sans relancer la machine : si l'argument est juste, peu importe qui l'a trouvé. En revanche, comprendre comment on y est arrivé, quelles pistes ont échoué, quelles idées se généralisent, cela demande d'accéder au processus. Or c'est souvent dans cette compréhension que naissent les mathématiques suivantes. Une preuve correcte mais opaque ressemble à une clé qui ouvre la porte sans qu'on puisse en faire le double.
Et l'étudiant en maths, dans tout ça ?
Revenons à l'inquiétude du début. Si l'on suit les chiffres plutôt que les gros titres, le métier ne disparaît pas. Son centre de gravité se déplace.
Première compétence qui prend de la valeur : vérifier. Lire une preuve écrite par un autre, humain ou non, et repérer l'étape fragile. C'est un savoir-faire exigeant, qu'on cultive peu en dehors des exercices du type « trouvez l'erreur ». Il devient central quand les manuscrits arrivent par centaines. Les assistants de preuve, des logiciels qui contrôlent mécaniquement un raisonnement une fois traduit dans un langage formel, sont une réponse possible. Reste à savoir si et quand les cursus leur feront une place.
Deuxième compétence : poser les bonnes questions. Quelqu'un a dressé la liste des 4 000 problèmes. Choisir ce qui mérite d'être démontré, reformuler une question floue en énoncé précis, sentir qu'un résultat est important : la machine, dans cette affaire, n'a rien fait de tout cela.
Troisième compétence : expliquer. Si 367 résultats sur 377 arrivent sans récit de leur démarche, il faudra des humains pour en extraire les idées, les enseigner, les relier au reste de l'édifice.
Rien de tout cela ne règle les questions ouvertes. Combien de ces solutions survivront à la relecture ? Quelle part est complète, quelle part partielle ? Comment évaluer un futur doctorant dont l'IA peut rédiger les lemmes, ces petits résultats intermédiaires qui servent d'étapes dans une preuve ? Les réponses viendront des universités, pas des communiqués.
Concepts à emporter
- L'IA d'OpenAI annonce 377 problèmes de maths résolus, mais elle en avait tenté environ 4 000. Elle a donc échoué à peu près neuf fois sur dix.
- Produire une preuve avec une IA prend quelques heures. La faire relire sérieusement par des humains peut prendre des semaines. Le goulot d'étranglement n'est plus la découverte, c'est la vérification.
- Sur 377 résultats, seuls 10 sont accompagnés d'une explication de la démarche de la machine. On a les réponses, pas le chemin pour y arriver.
- Une preuve juste reste juste, quel que soit son auteur. Mais une preuve qu'on ne comprend pas aide peu à démontrer la suivante.
Pourquoi 722 preuves presque sûres forment un ensemble fragile
Voici un petit modèle probabiliste, volontairement simplifié, pour comprendre pourquoi la vérification massive est si délicate. Les nombres utilisés sont des hypothèses, pas des mesures.
Supposons que l'on dispose de N manuscrits, chacun contenant une démonstration. Notons q la probabilité qu'un manuscrit donné contienne au moins une erreur fatale. Supposons enfin que ces erreurs surviennent indépendamment d'un manuscrit à l'autre, c'est-à-dire que la présence d'une erreur dans l'un ne renseigne en rien sur les autres.
Le nombre moyen de manuscrits erronés vaut alors N × q. La probabilité que tous les manuscrits soient corrects vaut (1 − q)N, puisqu'on multiplie les probabilités d'événements indépendants.
Prenons N = 722, le nombre de manuscrits rapporté par Quanta Magazine, et testons deux valeurs de q :
- Avec q = 1 %, chaque manuscrit est fiable à 99 %, ce qui semble excellent. Le nombre moyen de manuscrits défaillants est d'environ 7. La probabilité que les 722 soient tous justes vaut 0,99722 ≈ e−7,26 ≈ 0,0007, soit moins d'une chance sur mille.
- Avec q = 0,1 %, une fiabilité de 99,9 % par manuscrit, on attend en moyenne moins d'un manuscrit défaillant. Pourtant, la probabilité que tout soit juste n'est que de 0,999722 ≈ e−0,72 ≈ 0,49. C'est un pile ou face.
Le calcul approché utilise un résultat classique : pour q petit, (1 − q)N est très proche de e−Nq. L'enseignement est simple. Même avec une fiabilité individuelle très élevée, un grand corpus contient presque sûrement des erreurs quelque part. On ne peut donc pas valider l'ensemble « en bloc » : il faut examiner chaque pièce, ou disposer d'un outil de vérification mécanique dont le taux d'erreur est pratiquement nul.
Un second effet s'ajoute : le biais de sélection. Si l'on observe un taux de succès p = 377 / 4 000 ≈ 0,094, ce nombre décrit la performance sur l'échantillon choisi. Il ne s'étend à « l'ensemble des problèmes ouverts » que si l'échantillon est représentatif de cet ensemble. Sans connaître la règle qui a servi à sélectionner les 4 000 problèmes, la fraction de 9,4 % reste une mesure locale et non une capacité générale.