← Tous les articles
Modèle IA·6 min de lecture·Par Alan Sharif

DeepSeek V4 Flash : x7 De Performance Grâce Au Post-Entraînement

DeepSeek vient de publier une mise à jour qui paraît presque absurde. Son modèle V4 Flash est sorti il y a à peine quelques mois, et après une seule révision, ses performances ont explosé : sur l'un des benchmarks les plus exigeants pour les agents de programmation, son score a été multiplié par plus de 7. Et cette nouvelle version dépasse maintenant DeepSeek V4 Pro Preview sur plusieurs tâches, alors que le modèle Pro active presque quatre fois plus de paramètres à chaque token. Comment un modèle aussi léger peut-il progresser aussi vite ? La réponse tient presque entièrement dans le post-entraînement.

Un petit modèle qui dépasse son grand frère

DeepSeek V4 Flash utilise une architecture bien connue maintenant : le mixture of experts (mélange d'experts). Le modèle contient des centaines de milliards de paramètres au total, mais seulement 13 milliards environ sont activés pour traiter chaque token. C'est un peu comme une immense entreprise remplie de spécialistes : à chaque tâche, le système ne convoque que les experts réellement utiles.

À côté, DeepSeek V4 Pro Preview active près de 49 milliards de paramètres par token — presque quatre fois plus de capacité mobilisée. Sur le papier, Pro devrait avoir un avantage écrasant. Sauf que la nouvelle version de Flash le dépasse sur plusieurs tâches agentiques. DeepSeek a donc fait un bond énorme de performance sans transformer Flash en un modèle beaucoup plus gros. Et ça, on aime beaucoup.

Les chiffres : de 7,3 à 54,4 sur DeepSWE

Le premier benchmark s'appelle DeepSWE. Le principe : on donne au modèle un vrai problème logiciel, proche d'un ticket GitHub. Il doit ouvrir le dépôt, comprendre le projet, trouver l'origine du bug, modifier les bons fichiers, puis relancer des tests pour vérifier que la correction fonctionne. C'est un test redoutable, parce qu'un bon agent de programmation doit garder une stratégie cohérente pendant plusieurs étapes, utiliser les bons outils, et réagir quand une première tentative échoue. J'en avais fait une vidéo complète — c'est aussi ce benchmark qui a révélé que plusieurs IA majeures trichaient.

Les résultats :

Le deuxième résultat important vient de Terminal-Bench 2.1. Cette fois, le modèle travaille directement dans un terminal : manipuler des fichiers, lancer des commandes, installer des outils, résoudre des tâches en plusieurs étapes. Flash passe de 61,8 à 82,7, là où V4 Pro Preview atteignait 72,1.

Deux benchmarks, la même histoire : DeepSeek a surtout amélioré la capacité du modèle à travailler sur la durée, à enchaîner les bonnes décisions et à se rattraper quand une action échoue. Précision importante — les tests ont été réalisés avec le niveau de raisonnement maximal et le système d'agent maison de DeepSeek, donc dans une configuration optimisée pour les tâches complexes. Mais même avec cette nuance, l'écart avec l'ancienne version reste énorme.

Pré-entraînement vs post-entraînement : la vraie différence

Pour comprendre ce bond, il faut distinguer deux grandes étapes dans la création d'un modèle.

Le pré-entraînement, d'abord : le modèle absorbe d'immenses quantités de textes, de code et de données. Il apprend le langage, les concepts, et construit ses connaissances générales.

Puis vient le post-entraînement — l'étape qui nous intéresse ici. C'est la phase où on améliore la manière dont le modèle utilise ce qu'il sait déjà pour résoudre une tâche précise.

L'image la plus parlante, c'est les échecs. Quelqu'un peut connaître toutes les règles du jeu sans savoir construire une bonne stratégie. Avec de l'entraînement, il apprend à mieux choisir ses coups, à anticiper, à corriger ses erreurs. Pour une IA, c'est exactement pareil. Et c'est précisément cette étape que DeepSeek semble avoir particulièrement bien réussi : le modèle apprend à mieux planifier, à utiliser ses outils, à comparer plusieurs solutions et à ajuster sa méthode quand une première tentative échoue. Ce qui correspond très exactement aux compétences mesurées par DeepSWE et Terminal-Bench.

Comment ils ont fait : distillation + apprentissage par renforcement

Oui, les autres laboratoires font aussi du post-entraînement. Mais DeepSeek a obtenu ici un résultat particulièrement efficace — au point de faire progresser leur version Flash jusqu'à dépasser leur version Pro sur plusieurs tâches. Plusieurs méthodes semblent avoir contribué.

La première, c'est la distillation. DeepSeek s'appuie sur des modèles spécialisés — en programmation, en mathématiques, dans l'utilisation d'outils — puis transfère une partie de leur stratégie vers Flash. Imaginez plusieurs professeurs spécialisés qui transmettent chacun leur meilleure méthode au même élève.

La seconde, c'est l'apprentissage par renforcement. Pour une même consigne, le modèle génère plusieurs solutions, puis le système les compare et évalue leur efficacité. Dans le domaine du code, cette évaluation peut être très concrète : le programme est exécuté, les tests sont lancés, la correction est automatiquement vérifiée. Les trajectoires qui fonctionnent sont davantage récompensées. Au fil de l'entraînement, le modèle apprend à mieux organiser ses étapes, à choisir les bonnes actions, et à corriger le tir quand quelque chose casse.

DeepSeek n'a pas publié la recette exacte de cette mise à jour. Mais les informations disponibles placent clairement le post-entraînement au cœur du bond de performance.

Et DSpark dans tout ça ?

En parallèle, DeepSeek développe une technologie appelée DSpark, dont l'objectif est d'accélérer la génération grâce au décodage spéculatif. Un module léger propose plusieurs tokens à l'avance, puis le modèle principal vérifie plusieurs propositions en une seule opération. Les tokens validés sont conservés, ce qui permet de générer beaucoup plus vite tout en préservant le résultat du modèle principal. C'est un sujet passionnant que j'ai détaillé dans un article complet sur DSpark et le décodage spéculatif.

Ouvert, téléchargeable, et ridiculement peu cher

C'est peut-être le point le plus important de toute cette sortie. DeepSeek V4 Flash possède des poids téléchargeables sous licence MIT. Chercheurs et entreprises peuvent récupérer le modèle, l'héberger, le modifier, l'intégrer à leur propre système.

Attention quand même : le faire tourner localement demande une machine extrêmement puissante. Les versions quantifiées dépassent encore les 100 Go. On parle donc d'une grosse station de travail ou d'un serveur, pas d'un PC de gamer.

Pour la plupart des utilisateurs, l'API reste plus simple — et c'est là que DeepSeek frappe très fort : environ 14 centimes par million de tokens en entrée et 28 centimes en sortie. À ce prix, des agents peuvent travailler sur de grands dépôts de code, utiliser de nombreux outils et enchaîner plusieurs étapes de raisonnement avec un budget dérisoire. Un modèle performant sur les tâches agentiques, ouvert, téléchargeable et extrêmement peu coûteux : c'est exactement la stratégie que DeepSeek applique depuis la sortie de V4.

Mon avis

Ce qui me frappe, ce n'est pas le chiffre ×7 en lui-même — c'est d'où il vient. Pas d'un modèle plus gros. Pas de plus de GPU. Pas d'une nouvelle architecture révolutionnaire. Juste une meilleure manière de travailler : mieux planifier, utiliser les bons outils, tester ses solutions, corriger ses erreurs plus vite.

Ça confirme un pattern que je vois revenir sur presque tous les papiers récents : les prochaines avancées de l'IA ne viendront pas seulement de modèles plus gros, mais de meilleures méthodes d'apprentissage, de meilleures récompenses et de meilleurs comportements agentiques. C'est exactement le même esprit que les optimisations d'inférence de DeepSeek : gagner par l'intelligence du système plutôt que par la force brute.

Et soyons honnêtes sur ce que ça implique : si un modèle ouvert de 13 milliards de paramètres actifs peut multiplier ses performances agentiques par 7 en une seule révision, à 14 centimes le million de tokens… les modèles ouverts pourraient rattraper les systèmes les plus puissants du marché beaucoup plus vite que prévu.

📤 Partager :
DeepSeek vient de multiplier ses performances par 7

🎬 Tu préfères la version vidéo ?

Cet article est tiré de ma vidéo YouTube — clique pour la voir.

Regarder sur YouTube →

🛠️ Tu cherches des outils IA testés ?

J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.

Voir mon annuaire d'outils →
Alan Sharif

Alan Sharif — créateur de Nerdy Kings

Je teste les outils IA et je décrypte les nouveaux modèles pour ma communauté de 20 000+ curieux francophones sur YouTube. Sans bullshit, sans hype, sans jargon.