← Tous les articles
Recherche·5 min de lecture·Par Alan Sharif

L'inexplicable découverte cachée dans Claude

Comment Claude sait-il où couper une ligne de texte à la bonne largeur… alors qu'il ne voit jamais le texte, seulement une suite de tokens ? Une équipe de chercheurs en interprétabilité chez Anthropic vient de répondre à cette question, et la réponse est beaucoup plus étrange qu'un simple compteur de caractères : Claude construit, en interne, une véritable géométrie — un mécanisme qui rappelle celui que ton cerveau utilise pour savoir où tu te trouves dans une pièce.

Une question toute bête, jamais vraiment posée

Quand tu demandes à un LLM de formater du texte en largeur fixe — un tableau, un bloc de code commenté, du texte justifié dans un terminal — il doit savoir combien de caractères il lui reste avant d'atteindre la marge. Sauf qu'un LLM ne « voit » pas de texte au sens où on l'entend. Il manipule des tokens, des morceaux de mots convertis en nombres. Il n'a ni règle, ni curseur, ni notion native de « 80 caractères ». Et pourtant, ça marche, la plupart du temps. Comment ?

C'est exactement la question que se sont posée sept chercheurs d'Anthropic — Wes Gurnee, Emmanuel Ameisen, Isaac Kauvar, Julius Tarng, Adam Pearce, Chris Olah et Joshua Batson — dans un papier au titre qui claque : « When Models Manipulate Manifolds » (« Quand les modèles manipulent des variétés »). Leur cobaye : Claude 3.5 Haiku, disséqué mécaniquement sur une tâche unique — le retour à la ligne dans du texte à largeur fixe.

Des cellules de lieu... dans un modèle de langage

Ce qu'ils trouvent, c'est que le modèle ne représente pas le nombre de caractères comme un simple chiffre stocké quelque part. Il le représente comme des points sur des surfaces géométriques courbes, de faible dimension — des « variétés » (manifolds, en anglais). Ces variétés sont elles-mêmes découpées en petites unités que les chercheurs appellent des « familles de features » : des directions dans l'espace interne du modèle qui s'activent ensemble pour coder une position précise.

Le twist, c'est la comparaison que font les chercheurs eux-mêmes : cette organisation ressemble à celle des cellules de lieu (« place cells ») découvertes dans l'hippocampe des mammifères — le mécanisme qui a valu à John O'Keefe et au couple May-Britt et Edvard Moser le prix Nobel de médecine en 2014. Dans un cerveau biologique, ces cellules s'activent selon la position physique de l'animal dans son environnement. Dans Claude, une structure comparable semble encoder... une position dans une phrase.

Comment le modèle « sait » où est la marge

Une fois cette carte du nombre de caractères posée, des têtes d'attention viennent la manipuler directement pour estimer la distance qui reste avant la fin de la ligne. Les chercheurs montrent que ces variétés sont organisées de façon orthogonale les unes par rapport aux autres, ce qui crée des frontières de décision parfaitement linéaires — une manière, pour le modèle, de « lire » d'un coup d'œil géométrique s'il doit encore écrire des caractères ou couper la ligne maintenant.

Autre découverte : dès les premières couches, avant même de « réfléchir » au sens propre, le modèle effectue ce que les auteurs appellent un traitement sensoriel riche — une forme de perception précoce de la structure du texte, alors qu'il ne reçoit en entrée qu'une suite de tokens, sans jamais rien « voir » au sens visuel du terme.

Le vrai twist : les illusions qui trompent Claude

La partie la plus intéressante du papier, celle qui a servi de fil rouge à ma vidéo, ce sont les illusions. Les chercheurs sont parvenus à construire des séquences de caractères spécifiques capables de détourner ce mécanisme de comptage — de faire croire au modèle qu'il est plus proche ou plus loin de la marge qu'il ne l'est réellement. Résultat : des erreurs de mise en page provoquées volontairement, exactement comme une illusion d'optique trompe l'œil humain en lui faisant percevoir une ligne courbe là où elle est parfaitement droite.

Et c'est ça, pour moi, le point le plus fort du papier : une illusion, par définition, ne trompe que les systèmes qui utilisent un raccourci — une heuristique apprise, pas une règle universelle et robuste. Le fait que Claude puisse être « berné » de cette façon est la meilleure preuve que ce mécanisme n'est pas un module de calcul exact façon calculatrice, mais bien une construction géométrique apprise, avec ses failles.

Alors, étincelle d'intelligence ou pas ?

C'est tentant de conclure « Claude a un cerveau », « il perçoit l'espace comme nous »… Soyons honnêtes : ce serait aller beaucoup trop vite. Ce papier ne prouve ni conscience, ni compréhension au sens humain du terme. Il prouve juste qu'un modèle entraîné uniquement à prédire le prochain token peut, sans qu'on le lui demande explicitement, se construire une machinerie interne étonnamment sophistiquée pour résoudre un sous-problème très concret. Ce n'est pas de la magie, c'est de l'optimisation qui trouve la solution la plus efficace disponible dans l'espace des paramètres — et cette solution ressemble ici à de la géométrie parce que la géométrie est probablement l'outil le plus efficace pour ce genre de tâche, que ce soit dans un cerveau biologique ou dans un réseau de neurones artificiel.

Mon avis

Ce que je trouve le plus dingue, ce n'est pas l'existence de cette géométrie interne en elle-même — on savait déjà que les réseaux de neurones encodent des concepts de façon distribuée. Ce qui me bluffe, c'est le niveau de précision de l'interprétabilité mécaniste aujourd'hui : une équipe arrive à ouvrir la boîte noire, à isoler une tâche ultra spécifique — couper une ligne de texte — et à en extraire une structure mathématique complète, jusqu'à savoir exactement quelles séquences de caractères vont la faire dérailler.

Concrètement, est-ce que ça change quelque chose pour toi ? Pas directement. Mais ça montre que la recherche en interprétabilité — comprendre pourquoi un modèle fait ce qu'il fait, pas seulement constater qu'il le fait — avance vraiment vite chez Anthropic. Et dans un monde où on va de plus en plus confier des décisions à ces modèles, savoir précisément comment ils « pensent » en interne, ce n'est pas un détail académique. C'est probablement l'un des chantiers les plus importants de 2026.

📤 Partager :
L'inexplicable découverte cachée dans Claude

🎬 Tu préfères la version vidéo ?

Cet article est tiré de ma vidéo YouTube — clique pour la voir.

Regarder sur YouTube →

🛠️ Outils que tu peux tester en lien avec cet article

Une sélection de mes outils testés, pertinents pour aller plus loin.

🛠️ Tu cherches des outils IA testés ?

J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.

Voir mon annuaire d'outils →
Alan Sharif

Alan Sharif — créateur de Nerdy Kings

Je teste les outils IA et je décrypte les nouveaux modèles pour ma communauté de 20 000+ curieux francophones sur YouTube. Sans bullshit, sans hype, sans jargon.