← Tous les articles
Recherche·7 min de lecture·Par Alan Sharif

HICRA : La Preuve Que Les Modèles IA Géants Sont Finis

L'IA vit sa plus grande mutation depuis ChatGPT. Pendant 10 ans, la règle était simple : pour rendre une IA intelligente, il faut la faire grossir le plus possible. C'est ce qu'on appelle les scaling laws de Kaplan. Mais aujourd'hui, les gains de performance deviennent marginaux alors que les coûts d'entraînement se comptent en centaines de millions de dollars. On ne peut plus juste bourriner avec la taille.

On entre officiellement dans l'ère du test-time compute : ce qui compte, c'est le temps qu'on laisse à l'IA pour réfléchir avant de répondre. On passe de perroquets savants à des modèles qui raisonnent vraiment.

Système 1 vs Système 2

Concept emprunté à Daniel Kahneman.

Système 1 : votre intuition rapide et automatique. 2+2 ? Vous répondez 4 sans réfléchir. C'est ce que faisaient les LLM classiques — prédire le mot suivant le plus probable, instantanément. Très bien pour rédiger un poème ou un mail. Catastrophique pour la logique.

L'exemple culte : "combien de R dans le mot strawberry ?" Un modèle classique se trompe parce qu'il voit le mot comme un bloc, un token. Il ne le lit pas lettre par lettre.

Système 2 : une réflexion lente, logique, séquentielle. 17×24 ? Vous devez vous arrêter, poser le calcul. Les nouveaux modèles de raisonnement (O1, DeepSeek-R1) font ça : ils génèrent d'abord une chaîne de pensée, prennent le temps de vérifier leurs hypothèses, comptent les lettres une par une. Résultat contre-intuitif : un modèle bien plus petit, à qui on laisse 30 secondes pour réfléchir, peut écraser un modèle géant qui répond instantanément.

Comment apprend-on à une IA à prendre son temps ?

D'abord un cold start : on entraîne le modèle sur un petit jeu de données ultra qualitatif — quelques milliers de problèmes résolus étape par étape. Ça donne au modèle le goût de la structure logique.

Puis le Deep Reinforcement Learning. Des milliers de problèmes complexes (math, code, logique) avec une règle binaire impitoyable : réponse juste → récompense, fausse → zéro. On n'explique pas comment trouver la réponse. Le modèle se débrouille.

C'est là que les chercheurs ont observé le phénomène fascinant : l'émergence spontanée des moments "Aha!". Dans les logs d'entraînement de DeepSeek-R1, le modèle s'est mis à écrire des choses comme "Wait, I missed a step here" ou "Let's try a different approach". Personne ne lui a appris à dire "Wait". Le codeur n'a jamais écrit "si tu te trompes, recommence". Le modèle a découvert tout seul par essai-erreur que le backtracking était la stratégie optimale pour gagner sa récompense.

Pourquoi on ne le faisait pas avant : c'était trop cher

L'algorithme historique du RL, le PPO, fonctionnait avec un système de critique. Imaginez un élève (le modèle acteur) et un professeur (le modèle critique) assis à côté de lui en permanence. Le professeur note chaque phrase. Ça obligeait à charger deux modèles énormes en mémoire GPU. Pour 70 milliards de paramètres, ingérable.

La révolution GRPO : virer le professeur

Le GRPO (Group Relative Policy Optimization) est génial de simplicité. On vire le modèle critique. À la place, pour chaque question, on demande à l'élève de générer plusieurs copies de sa réponse — disons 64 versions différentes en parallèle. Puis on compare ces 64 solutions entre elles. On calcule la moyenne du groupe. Celles meilleures que la moyenne sont renforcées, les moins bonnes sont écartées.

Le modèle s'entraîne en compétition avec lui-même. Beaucoup plus léger, beaucoup plus stable, infiniment moins de ressources hardware. C'est grâce à ça que DeepSeek a pu rivaliser avec OpenAI et Google avec une fraction de leur budget.

La limite de GRPO : tous les tokens sont traités pareil

Imaginez que le modèle écrive 1000 mots pour arriver à la bonne réponse. Avec GRPO, si la réponse finale est bonne, on récompense les 1000 mots de la même façon. Mais que se passe-t-il si dans ces 1000 mots, le modèle a écrit un poème inutile au milieu, ou fait 3 erreurs qui se sont annulées par chance ? Le GRPO ne le voit pas. Il renforce le bruit. On appelle ça le problème de l'attribution de crédit.

HICRA : la chirurgie de précision

L'algorithme HICRA (Hierarchical Aware Credit Assignment), publié fin 2025, raffine tout ça. Il part du principe que tous les tokens ne se valent pas. Dans une démonstration mathématique, il y a du remplissage et il y a des pivots logiques.

HICRA utilise une analyse hiérarchique pour identifier les strategic grams — des petits marqueurs comme "supposons que", "cependant", "il s'ensuit que", "essayons". Ces mots signalent une étape de raisonnement, une bifurcation. HICRA modifie alors la distribution de la récompense : au lieu de dire "tout ton texte est bon", il dit "je te donne un bonus massif spécifiquement sur ce moment précis où tu as décidé de vérifier ton équation".

Il amplifie le signal sur les étapes clés et ignore le bruit. Sur GSM8K et MATH, HICRA surpasse nettement GRPO. Le modèle apprend plus vite, avec moins de données, parce qu'il comprend la structure de la logique — pas juste le résultat.

Mon avis

On a changé de paradigme. La performance d'une IA ne dépend plus seulement de la taille de son cerveau, mais de la qualité de son introspection. C'est une nouvelle frontière. On ne construit plus des chatbots qui discutent — on construit des agents capables de planification complexe, de codage autonome et d'autocorrection.

Demain, une IA pourra passer 20 minutes ou 2 heures à réfléchir à un problème scientifique ou à une stratégie business avant de vous répondre. Et cette réponse ne sera pas une prédiction de mots — ce sera le fruit d'une vraie délibération stratégique.

📤 Partager :
HICRA : La Preuve Que Les Modèles IA Géants Sont Finis

🎬 Tu préfères la version vidéo ?

Cet article est tiré de ma vidéo YouTube — clique pour la voir.

Regarder sur YouTube →

🛠️ Outils que tu peux tester en lien avec cet article

Une sélection de mes outils testés, pertinents pour aller plus loin.

🛠️ Tu cherches des outils IA testés ?

J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.

Voir mon annuaire d'outils →
Alan Sharif

Alan Sharif — créateur de Nerdy Kings

Je teste les outils IA et je décrypte les nouveaux modèles pour ma communauté de 20 000+ curieux francophones sur YouTube. Sans bullshit, sans hype, sans jargon.