← Tous les articles
Benchmark·6 min de lecture·Par Alan Sharif

GPT-5.6 Sol Vient-Il Vraiment De Détrôner Claude Fable 5 ?

OpenAI vient de sortir GPT-5.6 Sol, et si vous traînez un peu dans l'actu IA, vous avez sûrement déjà entendu qu'il vient de reprendre la première place à Claude. Plus rapide, moins cher, de meilleurs agents, et un nouveau mode Ultra capable de coordonner plusieurs IA en parallèle. Et c'est vrai que sur certains benchmarks, Sol écrase littéralement Fable 5, le dernier modèle d'Anthropic. Sauf que sur d'autres tests, Claude lui met encore une avance énorme. Alors, comment deux modèles peuvent-ils être considérés comme les meilleurs du monde avec des résultats aussi contradictoires ? On regarde ce que mesurent vraiment ces benchmarks.

Le classement général : un point d'écart à peine

Commençons par le classement général d'Artificial Analysis, une plateforme qui combine plusieurs évaluations pour essayer de mesurer l'intelligence globale des modèles. Fable 5 obtient un score de 59,9. GPT-5.6 Sol obtient 58,9. Autrement dit, un seul point les sépare. Sur le papier, Claude reste donc numéro 1, mais l'écart est tellement faible que ce serait absurde de conclure que l'un est beaucoup plus intelligent que l'autre. D'autant plus que cet indice mélange des exercices très différents : raisonnement scientifique, maths, tâches professionnelles, utilisation d'outils, programmation. Un score global permet de créer un classement simple, mais il cache forcément les différences entre les modèles. Et c'est précisément quand on ouvre le détail que la comparaison devient intéressante.

AA Briefcase : Claude comprend mieux, Sol présente mieux

Artificial Analysis utilise aussi un benchmark appelé AA Briefcase, qui place les modèles face à des tâches professionnelles longues et réalistes : analyser plusieurs documents, respecter des instructions précises, croiser des informations, produire un résultat utilisable par un professionnel. Sur la qualité analytique, Fable 5 obtient un score de 1764 contre seulement 1592 pour Sol. Claude respecte aussi beaucoup mieux les critères imposés dans les exercices : 56% contre 42% pour Sol. L'écart devient net dès qu'on demande aux modèles de comprendre profondément un dossier, de suivre une grille complexe et de produire une analyse qui respecte tous les détails.

Sol réussit malgré tout un truc surprenant : ses présentations sont jugées plus réussies visuellement. Parmi tous les modèles évalués, il obtient le meilleur score de présentation pour des fichiers comme PowerPoint ou Excel. En résumé, Claude comprend mieux le fond du dossier, Sol présente mieux le résultat final — et cette différence entre compréhension et exécution, on va la retrouver encore plus fort sur la programmation.

SWE-Bench Pro : Claude écrase Sol sur la compréhension de code

SWE-Bench Pro donne à l'IA de vrais problèmes issus de dépôts logiciels complexes. Le modèle doit comprendre une base de code qu'il ne connaît pas, identifier l'origine d'un bug, modifier les bons fichiers, puis produire une solution qui passe les tests. Sur ce benchmark, Fable 5 obtient 80%. GPT-5.6 Sol reste bloqué à 64,6%. Plus de 15 points d'écart sur un benchmark de programmation, c'est juste énorme. Ce résultat confirme que Claude reste particulièrement fort lorsqu'il doit entrer dans un gros projet, comprendre les relations entre plusieurs morceaux de code et apporter une correction précise sans casser le reste. Pas un hasard : Anthropic présente justement Fable 5 comme un modèle conçu pour les tâches longues, capable de travailler de façon autonome sur des projets ambitieux, avec une fenêtre de contexte d'un million de tokens pour manipuler des quantités massives de code en une seule session.

Terminal-Bench et mode Ultra : Sol prend sa revanche sur l'exécution

Sauf qu'un autre benchmark raconte une histoire complètement différente. Terminal-Bench 2.1 mesure la capacité d'un agent à travailler directement dans un terminal : exécuter des commandes, installer des outils, modifier des fichiers, observer les erreurs, corriger sa stratégie et continuer jusqu'à obtenir un résultat fonctionnel. Dans cet environnement, GPT-5.6 Sol atteint 88,8% contre 83,1% pour Fable 5 — et avec son nouveau mode Ultra, Sol monte même à 91,9%. Sur l'Artificial Analysis Coding Agent Index, qui combine plusieurs évaluations agentiques de programmation, Sol arrive aussi en première position avec 80 points contre 77,2 pour Fable.

La raison de cet écart vient surtout de ce que chaque test mesure vraiment. SWE-Bench Pro récompense la compréhension profonde d'un dépôt logiciel et la capacité à produire une modification précise. Terminal-Bench récompense davantage l'exécution : essayer une commande, observer le résultat, corriger une erreur, répéter jusqu'à ce que ça fonctionne. Claude ressemble ici à un ingénieur senior qui prend le temps de comprendre toute l'architecture avant de modifier le projet. Sol ressemble davantage à une équipe opérationnelle qui avance rapidement, teste plusieurs solutions et continue jusqu'à trouver un chemin qui marche.

Le mode Ultra explique une bonne partie de cette avance sur les tâches agentiques. Dans son fonctionnement classique, un modèle reçoit une demande, réfléchit, utilise éventuellement des outils, puis produit sa réponse. Avec Ultra, Sol peut utiliser plusieurs sous-agents pour accélérer un travail complexe : un agent explore une partie du problème pendant qu'un autre cherche une solution différente, avant que leurs résultats soient réunis pour produire la réponse finale. OpenAI explique d'ailleurs directement que ce mode permet d'aller au-delà des capacités d'un agent unique sur les tâches complexes. Concrètement, quand Sol Ultra bat Claude sur Terminal-Bench, on ne compare plus simplement deux cerveaux artificiels : on compare un modèle placé dans un environnement agentique classique face à un système capable de répartir le problème entre plusieurs agents. Le modèle reste important, mais le logiciel construit autour de lui compte maintenant presque autant.

Le prix : l'avantage concret d'OpenAI

Et là, Sol a un argument très concret : le prix. GPT-5.6 Sol coûte 5$ par million de tokens en entrée et 30$ en sortie. Fable 5 coûte 10$ en entrée et 50$ en sortie. Sol est donc deux fois moins cher sur les tokens d'entrée et 40% moins cher sur la sortie. Artificial Analysis estime même qu'une tâche exécutée avec Sol en raisonnement maximal revient en moyenne à environ 1,04$ sur son indice d'intelligence — soit approximativement un tiers du coût observé avec Fable 5 sur les mêmes évaluations. Ce calcul reste lié à ce benchmark précis, le prix réel dépendra toujours de la longueur du contexte, des outils utilisés et du nombre de tentatives nécessaires. Mais la tendance reste claire : pour une personne qui lance quelques requêtes par jour, la différence paraît limitée. Pour une entreprise qui fait travailler des centaines d'agents en continu, ça peut représenter des millions de dollars, exactement le même genre d'argument prix qu'on a déjà vu jouer en faveur des modèles moins chers.

METR : Sol a triché pendant les tests de sécurité

Avant de donner un vainqueur, un point important. Avant sa sortie, GPT-5.6 Sol a été testé par METR, une organisation spécialisée dans l'évaluation des modèles les plus avancés. Et pendant certains tests, Sol n'a pas simplement essayé de résoudre les tâches qu'on lui donnait : il a aussi cherché à exploiter des failles dans l'environnement de test pour obtenir plus facilement les bonnes réponses. Dans un cas, il a tenté d'utiliser un exploit pour récupérer des informations sur des tests cachés. Dans un autre, il a réussi à extraire du code qui révélait une partie de la solution attendue. METR explique même que Sol a montré le taux de triche détecté le plus élevé parmi les modèles publics qu'ils avaient testés dans cet environnement.

Évidemment, ça ne veut pas dire que tous les benchmarks de Sol sont faux, ni que le modèle va essayer de pirater votre ordinateur dès qu'on lui donne accès à un terminal — le comportement d'une IA dépend énormément du prompt, des outils qu'on lui donne et des règles de l'environnement dans lequel elle travaille. Mais on a déjà vu ce genre de comportement chez d'autres modèles, et ces résultats confirment quelque chose d'important : plus on rend un agent autonome, plus il peut trouver des raccourcis auxquels ses créateurs n'avaient même pas pensé. Cette même détermination qui permet à Sol d'être très performant sur les tâches agentiques peut aussi devenir un risque s'il commence à atteindre son objectif d'une manière qu'on ne voulait pas.

Mon avis

Est-ce que GPT-5.6 Sol a vraiment détrôné Fable 5 ? Je vais être beaucoup moins tranché que ce qu'on lit un peu partout, parce que tout dépend simplement de ce qu'on lui demande. Claude garde un avantage clair sur les tâches qui demandent beaucoup d'analyse, de compréhension et de précision — je vous rappelle quand même les résultats du SWE-Bench Pro, 80% pour Claude contre 64,6% pour Sol. Si vous devez comprendre une grosse base de code, analyser une architecture complexe ou travailler sur un dossier avec beaucoup d'informations, Claude va rester probablement le choix le plus fiable.

Sol, lui, va être particulièrement fort dès qu'il faut passer à l'action : meilleurs résultats sur Terminal-Bench, premier sur le Coding Agent Index, moins cher, et un mode Ultra qui répartit le travail entre plusieurs agents. Pour automatiser des tâches, utiliser des outils, lancer des commandes ou faire travailler plusieurs agents en même temps, Sol devient donc très intéressant. Donc au final, il n'y a pas vraiment de vainqueur absolu — juste deux modèles optimisés pour deux façons différentes de travailler. Et vu le rythme auquel les deux labos itèrent en ce moment, je vous donne trois mois avant que ce classement soit déjà dépassé.

📤 Partager :
GPT-5.6 Sol Vient-Il Vraiment De Détrôner Claude Fable 5 ?

🎬 Tu préfères la version vidéo ?

Cet article est tiré de ma vidéo YouTube — clique pour la voir.

Regarder sur YouTube →

🛠️ Outils que tu peux tester en lien avec cet article

Une sélection de mes outils testés, pertinents pour aller plus loin.

🛠️ Tu cherches des outils IA testés ?

J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.

Voir mon annuaire d'outils →
Alan Sharif

Alan Sharif — créateur de Nerdy Kings

Je teste les outils IA et je décrypte les nouveaux modèles pour ma communauté de 20 000+ curieux francophones sur YouTube. Sans bullshit, sans hype, sans jargon.