Loop Transformers : La Fin Du Raisonnement En Tokens ?
Est-ce que Claude réfléchit différemment de ChatGPT ? Pas au niveau du prompt système — au niveau de l'architecture, en dessous. Une théorie circule en ce moment dans la recherche IA : au lieu de faire "parler" un modèle pour qu'il réfléchisse (le chain of thought classique, plein de tokens générés avant la réponse), les loop transformers font boucler quelques couches du réseau sur elles-mêmes, en laissant l'état interne se raffiner directement, sans jamais passer par du texte. Et certains chercheurs soupçonnent que c'est un des mécanismes qui tournerait derrière Claude.
Pourquoi le chain of thought est un peu du bricolage
Aujourd'hui, tous les modèles de raisonnement — o3, Gemini Thinking, DeepSeek R2, peu importe — font tous la même chose : avant de répondre, ils génèrent une tonne de texte pour "réfléchir tout haut". Ça marche très bien, c'est devenu le standard absolu. Mais soyons honnêtes deux secondes : c'est une méthode un peu bizarre. Une IA qui doit littéralement s'écrire des mots à elle-même pour arriver à penser.
Prenez une question simple : "qui est la femme du 44e président américain ?" Pour répondre, le modèle doit faire deux étapes : retrouver que le 44e président, c'est Obama, puis se souvenir que sa femme, c'est Michelle. Deux étapes qui dépendent l'une de l'autre — du raisonnement multi-hop, à plusieurs sauts. Une question à une seule étape, une IA la résout par pur pattern matching. Mais dès que ça enchaîne plusieurs étapes dépendantes, il faut suivre un fil, garder une trace de où on en est — et un modèle classique doit faire tout ça en un seul passage, sans jamais revenir en arrière.
C'est exactement le problème que le chain of thought est venu résoudre : au lieu de forcer le modèle à tout résoudre en un coup, on le laisse écrire une étape intermédiaire, la relire, ajuster son raisonnement, écrire l'étape suivante. Le souci, c'est ce qui se passe sous le capot : chaque mot du raisonnement doit être transformé en texte, collé à la suite de tout ce qui a déjà été écrit, puis retransformé en représentation interne pour l'étape suivante. Le modèle compresse, décompresse, recompresse en permanence, juste pour garder le fil de sa propre pensée. Un peu comme si, pour résoudre un problème de maths, vous étiez obligé d'écrire chaque étape sur un post-it, de le relire à voix haute, puis de le redéchiffrer avant de pouvoir penser à l'étape suivante.
Et si on bouclait le cerveau au lieu de faire parler la bouche
La question logique, c'est : et si le modèle pouvait raffiner sa pensée directement, à l'intérieur, sans jamais passer par des mots ? C'est l'idée derrière les loop transformers, un concept qui a explosé en popularité en avril 2026. Le principe est simple : d'habitude, un modèle de langage est une pile de dizaines de couches différentes, et l'info traverse cette pile une seule fois. Avec un loop transformer, on prend un petit bloc de quelques couches et, au lieu de l'utiliser une seule fois, on le fait tourner en boucle sur lui-même. La sortie de la première boucle redevient l'entrée de la deuxième, qui redevient l'entrée de la troisième — le modèle raffine son état interne sans jamais avoir besoin de sortir du texte pour "s'auto-relire".
C'est là que le lien avec Claude entre en jeu. Certains chercheurs soupçonnent que ce mécanisme expliquerait pourquoi Claude s'en sort particulièrement bien sur des benchmarks de logique pure, genre parcourir un graphe ou faire un BFS — des tâches où il faut suivre un chemin étape par étape, exactement le genre de problème où boucler un état interne a plus de sens que d'écrire des tokens. Attention, c'est une théorie de chercheurs qui observent un comportement : Anthropic n'a jamais confirmé ça officiellement. Mais le fait que des chercheurs sérieux commencent à creuser cette piste précisément à cause du comportement de Claude mérite qu'on s'y attarde.
Un papier publié en avril 2026, "Loop, Think and Generalize", a testé exactement ce setup. En observant l'entraînement, les chercheurs voient le modèle traverser trois stades bien distincts. D'abord la mémorisation : le modèle apprend par cœur les exemples, sa performance sur les données d'entraînement grimpe et plafonne. Ensuite la généralisation : il commence à généraliser, mais seulement sur des problèmes qui ressemblent à ce qu'il a déjà vu. Enfin, le stade le plus intéressant, la généralisation systématique : le modèle devient capable de combiner des bouts de connaissance d'une manière qu'il n'a jamais vue pendant l'entraînement. Il a appris une vraie procédure de raisonnement réutilisable, pas juste des réponses par cœur — quelque chose qu'un transformer classique galère à faire.
Le nombre de boucles comme curseur de réflexion
Le détail le plus dingue : si on augmente le nombre de boucles au moment de l'utilisation, même au-delà de ce que le modèle a vu pendant l'entraînement, il devient capable de résoudre des problèmes encore plus complexes. Le nombre de boucles devient littéralement un curseur — vous voulez que le modèle réfléchisse plus longtemps sur un problème dur ? Vous augmentez le nombre de boucles.
Évidemment, dès qu'on boucle une architecture sur elle-même, ça crée un nouveau souci : l'instabilité. Un peu comme un larsen dans un micro trop proche d'un ampli — dès que le signal se réinjecte en boucle sur lui-même, la moindre petite erreur peut s'amplifier à chaque tour et finir par tout faire exploser. Un papier appelé "Parsy" s'est penché là-dessus, avec une solution qui consiste à mettre des garde-fous mathématiques pour empêcher l'état interne de s'emballer à chaque boucle.
Est-ce que le modèle réfléchit vraiment
Une meilleure performance sur des benchmarks ne prouve rien en soi — ça peut être un heureux hasard statistique. C'est là qu'une analyse mécaniste des modèles à boucle, publiée aussi en avril 2026, devient passionnante. Les chercheurs ont suivi l'état interne du modèle à chaque boucle. Comme cet état a des milliers de dimensions, ils utilisent une technique un peu comme une carte satellite qui dézoome : au lieu d'afficher chaque pixel, elle ne garde que les grandes tendances, pour projeter tout ce chaos sur une carte en 2D ou 3D et voir si le modèle part dans tous les sens ou suit une trajectoire cohérente.
Résultat : le modèle suit effectivement des trajectoires stables, et en regardant de plus près comment il utilise son attention à chaque boucle, les chercheurs remarquent que les boucles se répartissent en trois rôles bien distincts, presque comme un vrai processus de réflexion. Les premières boucles servent à comprendre grossièrement le problème. Les boucles du milieu servent à relier les informations entre elles. Les dernières boucles servent à stabiliser, à converger vers la réponse finale. C'est le même bloc de couches qui fait tout ça à chaque fois — c'est juste que ce qu'on lui donne en entrée change à chaque boucle, ce qui le force à se comporter différemment à chaque étape. Exactement ce qu'on penserait si on imaginait une vraie réflexion humaine, en plus mécanique. Ce genre de travail rejoint d'ailleurs les efforts en interprétabilité côté Anthropic, qui cherchent aussi à comprendre ce qui se passe à l'intérieur d'un modèle quand il ne le dit pas — et il fait écho à d'autres pistes récentes comme les agents qui pensent sans mots ou les RLM du MIT, qui explorent tous cette même idée : sortir le raisonnement du texte.
Petit aparté : un autre papier, "Mixture of Recursions", a remarqué qu'on gaspille du calcul en forçant chaque mot à passer par le même nombre de boucles, même les mots faciles. Leur solution est un routeur qui décide combien de boucles chaque mot mérite vraiment, avec des astuces pour économiser la mémoire que ça consomme. Rien qui change de paradigme, mais une bonne optimisation d'ingénierie.
Mon avis
Est-ce que les loop transformers vont remplacer le chain of thought demain ? Non, clairement pas, pour une raison simple : le chain of thought a un avantage déloyal, il est écrit en texte. Ça veut dire qu'on peut le superviser, le corriger, l'entraîner directement dessus. Un modèle à boucle réfléchit dans un espace caché, invisible, qu'on ne peut pas relire ni corriger facilement. Architecturalement, c'est plus propre — mais pour l'entraîner, c'est beaucoup plus dur à contrôler. Et concrètement, si vous n'êtes pas limité en mémoire, ajouter simplement plus de paramètres à un modèle classique gagne quasiment toujours contre le fait de boucler un petit bloc.
Là où je trouve ça vraiment excitant, c'est pour les petits modèles, ceux qu'on fait tourner sur un téléphone ou en local, là où on ne peut pas se permettre d'avoir des milliards de paramètres mais où on veut quand même un vrai raisonnement itératif. Sur la question Claude, je reste prudent : c'est une théorie de chercheurs qui observent un comportement, pas une confirmation d'Anthropic. Mais c'est exactement le genre de piste de recherche qui, dans six mois, pourrait bien devenir la norme sur les petits modèles. À suivre de très près.

🎬 Tu préfères la version vidéo ?
Cet article est tiré de ma vidéo YouTube — clique pour la voir.
Regarder sur YouTube →🛠️ Outils que tu peux tester en lien avec cet article
Une sélection de mes outils testés, pertinents pour aller plus loin.
🛠️ Tu cherches des outils IA testés ?
J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.
Voir mon annuaire d'outils →



