650 Échecs Plus Tard, Claude Fait Une Découverte Sur Riemann
Anthropic vient de révéler une expérience assez folle : ils ont pris une version de recherche de Claude, même pas encore disponible au public, et lui ont demandé de s'attaquer sérieusement à l'hypothèse de Riemann — l'un des problèmes les plus célèbres des mathématiques, non résolu depuis plus de 160 ans, avec un prix d'un million de dollars à la clé. Spoiler : non, Claude ne l'a pas résolue. Mais ce qui s'est passé pendant cette expérience est bien plus intéressant que le résultat lui-même.
C'est quoi, l'hypothèse de Riemann ?
Pas besoin de rentrer profondément dans les maths pour comprendre l'enjeu. L'hypothèse de Riemann date de 1859 et concerne indirectement la distribution des nombres premiers — ces nombres comme 2, 3, 5, 7 ou 11 qui jouent un rôle fondamental en mathématiques.
Pour les étudier, les mathématiciens utilisent une fonction appelée fonction zêta de Riemann, qui possède ce qu'on appelle des « zéros ». L'hypothèse affirme que tous les zéros non triviaux de cette fonction se trouvent exactement sur une ligne particulière, la droite critique. Personne n'a réussi à démontrer que c'est vrai pour tous ces zéros. En revanche, les mathématiciens ont réussi à le prouver pour une certaine proportion d'entre eux. Et c'est précisément là que Claude intervient.
Alors, Claude a-t-il résolu Riemann ?
Non. Mais avant cette expérience, les meilleurs résultats permettaient de garantir qu'environ 41,6 % des zéros se trouvent sur la droite critique. La nouvelle méthode découverte par Claude fait grimper cette proportion à environ 67,2 %. C'est une progression énorme.
Mais attention à ne pas la sur-interpréter : ça ne veut absolument pas dire que Claude a « résolu 67 % » de l'hypothèse. Même si on arrivait à démontrer que 99,999 % des zéros se trouvent sur cette ligne, l'hypothèse ne serait toujours pas prouvée — un seul contre-exemple pourrait suffire à la rendre fausse. Anthropic reconnaît d'ailleurs elle-même que cette nouvelle méthode ne semble pas pouvoir mener directement à une preuve complète. Ce que Claude a fait, concrètement, c'est trouver une manière inédite de combiner des résultats mathématiques récents (les travaux d'Aryan, Baluyot, Goldston, Suriajaya et Turnage-Butterbaugh) avec un résultat plus ancien de Bombieri datant de 2000 — en traitant l'espace entier avec positivité et négativité définies ensemble, dans une formulation de forme quadratique.

650 idées ratées, puis un vrai petit labo de recherche
Et ce qui est intéressant, c'est que Claude n'a absolument pas trouvé la réponse du premier coup. Lors d'une première phase, le système a exploré environ 650 idées différentes sans qu'aucune ne fonctionne. Anthropic a ensuite laissé Claude chercher beaucoup plus longtemps avec beaucoup plus de ressources : deux sessions, environ 31 millions de tokens de sortie, et surtout une soixantaine de sous-agents travaillant en parallèle pendant environ un jour et demi.
Concrètement, ça donnait quelque chose comme :
- Des agents qui développaient les principales pistes mathématiques
- D'autres qui exploraient des approches alternatives
- Un dernier groupe chargé uniquement de vérifier les résultats et de chercher les erreurs
Autrement dit, on est très loin du scénario où quelqu'un écrit un prompt parfait et obtient la réponse immédiatement. Ça ressemble beaucoup plus à un vrai petit laboratoire de recherche automatisé, avec une répartition des rôles entre agents — un peu la même logique que ce qu'on voit émerger sur les outils d'équipes d'agents IA qui se spécialisent et se critiquent entre eux, mais appliqué ici à un problème de recherche fondamentale.

Le moment bizarre : 37 minutes de silence
Un des sous-agents explorait une approche basée sur une idée mathématique existante, mais a fini par conclure que cette piste ne pouvait pas fonctionner comme prévu. Au lieu de s'arrêter là, il a retourné le problème et essayé de regarder la même structure d'une manière différente.
Et c'est là qu'il se passe quelque chose d'assez étrange dans les logs : pendant environ 37 minutes, le sous-agent reste quasiment silencieux. Puis une nouvelle idée apparaît d'un seul coup et permet d'obtenir un résultat important, autour de 50 %. Sauf que même Claude trouve immédiatement ce résultat suspect. Il écrit littéralement : « too strong to be new » — en gros, le résultat lui semble tellement fort qu'il suppose soit qu'il existe déjà quelque part, soit qu'il a fait une erreur.
L'orchestrateur principal partage ce scepticisme et lance plusieurs autres agents pour essayer activement de démonter le raisonnement. Ils trouvent bien quelques éléments à corriger, mais aucune erreur capable de faire disparaître le résultat principal. Une nouvelle phase de recherche permet ensuite de renforcer la méthode jusqu'au fameux résultat d'environ 67 %.

Comment on sait que Claude n'a pas halluciné une preuve
C'est la question qui compte le plus, honnêtement. Une IA qui « invente » un résultat mathématique avec assurance, ce n'est pas nouveau. Donc Anthropic a mis en place plusieurs couches de vérification :
- D'autres agents ont été chargés de reproduire le raisonnement et de chercher des contre-exemples
- Claude a téléchargé 54 articles scientifiques pour vérifier si l'idée était réellement nouvelle
- Des mathématiciens humains (Levent Alpöge et Ralph Furman côté Anthropic, puis les experts externes Brian Conrey et Dan Goldston) ont examiné le résultat et fait une re-dérivation indépendante
- La preuve a été formalisée avec Lean, un assistant de preuve qui vérifie de manière extrêmement rigoureuse que chaque étape du raisonnement respecte les règles mathématiques
Le résultat reste très récent et devra encore être étudié en profondeur par la communauté mathématique. Mais à ce stade, aucune erreur fatale n'a été identifiée publiquement.
Le détail le plus marrant de toute l'histoire
La personne qui a lancé l'expérience, Jared Somner, n'est même pas mathématicien. Et Anthropic explique que pendant une grande partie du processus, ses interventions se résumaient principalement à des messages du genre « keep going » ou « believe in yourself ». Après les ingénieurs en prompt, on va bientôt avoir des coachs de vie spécialisés pour IA. Évidemment, Claude n'a pas besoin de soutien émotionnel au sens propre — mais ces messages l'incitaient surtout à continuer ses recherches au lieu d'abandonner trop vite après 650 échecs consécutifs.
Mon avis
Soyons honnête : Claude n'a pas résolu l'hypothèse de Riemann, et cette méthode ne permettra peut-être jamais d'y arriver. Ce n'est pas de l'AGI, ce n'est pas une « étincelle d'intelligence » spontanée — c'est le résultat de 60 agents, 31 millions de tokens, et un jour et demi de calcul brut sur un problème extrêmement borné et vérifiable formellement. Un peu comme pour la géométrie interne que Claude utilise pour compter des caractères : ce qu'on observe, c'est un mécanisme bricolé et impressionnant, pas une compréhension au sens humain.
Mais ce qui me frappe vraiment, c'est ce que ça montre sur la trajectoire. Jusqu'ici, les LLM étaient essentiellement bons pour comprendre et résumer des découvertes déjà faites par des humains. Là, on a un système qui explore, qui se trompe 650 fois, qui doute de son propre résultat, qui se fait vérifier par des dizaines d'autres instances de lui-même, et qui finit par produire quelque chose que des mathématiciens reconnus valident. C'est un vrai changement de nature, même si le problème choisi était taillé pour ça (formellement vérifiable, borné, avec une littérature énorme à digérer).
La vraie question pour la suite : est-ce que ça marche uniquement parce que Riemann est un terrain de jeu mathématique parfait pour ce genre d'approche brute-force-plus-vérification ? Ou est-ce qu'on vient de voir le prototype d'un vrai laboratoire de recherche autonome, applicable à d'autres domaines ? À suivre de très près.

🎬 Tu préfères la version vidéo ?
Cet article est tiré de ma vidéo YouTube — clique pour la voir.
Regarder sur YouTube →🛠️ Tu cherches des outils IA testés ?
J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.
Voir mon annuaire d'outils →



