DeepSeek Dual Path : Doubler Les Perfs IA Sans GPU
Les entreprises dépensent des centaines de millions de dollars en serveurs IA remplis de GPU ultra puissants. Et une grande partie du temps, ces GPU tournent à 20-30% de leur capacité — pas parce qu'ils sont faibles, mais parce qu'ils attendent les données. DeepSeek vient de publier un papier, Dual Path, qui règle une grosse partie du problème sans acheter le moindre nouveau GPU.
Comment un LLM génère vraiment du texte
Avant de comprendre l'astuce, faut comprendre ce qui se passe sous le capot. Quand tu envoies un prompt à un LLM, il se passe deux choses très distinctes :
Phase 1 — Le prefill. Le modèle lit ton message d'un coup, analyse tous tes tokens en parallèle, calcule l'état de chaque mot dans sa mémoire et stocke tout ça dans le KV cache. C'est brutal, c'est dense, ça demande énormément de puissance. Les GPU tournent à 90-95% d'utilisation.
Phase 2 — Le decode. Le modèle génère la réponse un token à la fois. Et là tout se complique : pour générer chaque nouveau mot, il doit relire l'intégralité du KV cache depuis la mémoire. Encore et encore. Ça demande très peu de calcul mais énormément de bande passante mémoire. Résultat : les GPU tombent à 20-30% d'utilisation, toute la puissance tourne dans le vide à attendre que la mémoire suive.
Le truc pervers : le decode représente 95% du temps de vie d'une requête. Pour une réponse de 300 tokens, c'est 20 millisecondes de prefill contre 9 secondes de decode. Tu payes des H100 au prix de l'or pour qu'ils se tournent les pouces la quasi-totalité du temps.
La première tentative : désagréger prefill et decode
L'industrie a commencé à corriger ça avec la désagrégation. Au lieu d'une seule flotte de serveurs qui fait les deux, on les sépare : des machines spécialisées pour le prefill, d'autres pour le decode. Chacun fait son boulot, plus d'interférence. En production, ça donne des gains de débit de 2 à 7×.
Mais cette solution a créé un autre problème. Évidemment, ça aurait été trop simple.
Le mur de l'agentique : 98,7% de contexte déjà existant
Un chatbot classique c'est simple : tu poses une question, tu as une réponse, c'est fini. L'agentique c'est très différent. Un agent autonome tourne en boucle, exécute du code, appelle des outils, raisonne sur des dizaines voire des centaines d'itérations. À chaque tour, le contexte s'accumule.
DeepSeek a analysé ses propres traces de production. Résultat : une session agentique moyenne, c'est 157 itérations avec un contexte cumulé de 32 000 tokens. Mais à chaque tour, l'agent n'ajoute que 409 nouveaux tokens en moyenne. Autrement dit, 98,7% du contexte existe déjà dans les tours précédents.
Le KV cache est presque toujours là quelque part sur le disque. La phase de prefill ne calcule presque plus rien : elle passe son temps à aller chercher ce cache sur le stockage et à le charger en mémoire. Et là, mur.
Dans l'architecture classique, c'est toujours la machine de prefill qui doit aller chercher les données. La carte réseau de stockage de cette machine est saturée. Pendant ce temps, les machines de decode (qui représentent la majorité du cluster) ont leur propre carte réseau de stockage complètement inactive. Les tuyaux sont vides, le débit global s'effondre.
Dual Path : deux chemins simultanés
L'insight des chercheurs de DeepSeek, Pékin et Tsinghua est ridiculement simple : pourquoi est-ce que seule la machine de prefill a le droit d'aller chercher les données sur le stockage ?
Dual Path, c'est exactement ça : deux chemins simultanés pour charger le KV cache.
- Chemin A — classique. La machine de prefill va chercher les données sur le stockage comme d'hab, traite tout ça couche par couche et envoie le résultat vers la machine de decode via le réseau inter-GPU.
- Chemin B — le détournement. En parallèle, la machine de decode utilise ses propres cartes réseau de stockage (jusque-là inactives) pour aller chercher elle-même l'historique du cache directement depuis le stockage.
Et là, intelligent : comme la machine de decode a déjà le gros du cache historique après le prefill, la machine de prefill n'a plus besoin de lui envoyer les gigaoctets. Elle envoie juste le petit cache incrémental des nouveaux tokens. Le decode fusionne et c'est parti.
L'éviter de tout casser : priorité au modèle
Tu as peut-être déjà repéré le risque : si Dual Path commence à envoyer beaucoup de données dans le réseau, il peut entrer en concurrence avec les communications dont le modèle a besoin pour générer sa réponse. Mal géré, tout ralentit.
La solution : le trafic du modèle passe toujours en priorité. C'est comme une autoroute avec une voie réservée aux urgences. Les données importantes du modèle passent d'abord. Dual Path utilise seulement la bande passante restante quand le modèle est moins occupé.
Le système surveille en temps réel quelles machines sont les moins chargées. Si le chemin classique est bouché → bascule vers l'autre. Si l'autre est plus lent → retour au classique.
Les résultats
En production :
- L'utilisation des machines passe de 40% à 80%
- Le débit d'inférence double
- Le premier token arrive 56% plus vite
- Zéro nouveau GPU acheté
Le contexte plus large : optimiser autour des GPU
Dual Path ne sort pas de nulle part. C'est une pièce d'un mouvement beaucoup plus large dans l'infra IA : arrêter de traiter les GPU comme le seul problème, optimiser tout ce qu'il y a autour. Parce que dans un data center IA, il y a aussi la mémoire, les SSD, le réseau, le système de fichiers, le cache. Si une seule de ces pièces bloque, toute la machine ralentit.
C'est pour ça qu'apparaissent en parallèle des systèmes comme HiCache (organise le KV cache sur 3 niveaux : mémoire GPU → RAM serveur → stockage persistant), Mooncake (Best Paper à FAST 2025, exploite les ressources sous-utilisées d'un cluster), et 3FS (le système de fichiers distribué open source de DeepSeek, conçu pour les workloads IA).
Mon avis : la Chine répond avec du logiciel
Il y a évidemment un contexte géopolitique derrière tout ça. Depuis 2022, les États-Unis limitent l'accès de la Chine aux GPU Nvidia les plus avancés (A100, H100). Les laboratoires chinois ont une pression énorme : obtenir plus de performance avec moins de hardware brut.
Dual Path c'est exactement ça : une réponse logicielle à une contrainte matérielle. Au lieu de dire "on achète plus de GPU", DeepSeek dit "on va mieux utiliser ce qu'on a déjà". C'est ce qui rend le papier passionnant. On ne parle pas d'un modèle plus intelligent — on parle d'une infrastructure plus intelligente.
La Chine vient de prouver qu'on peut doubler les performances d'une infrastructure entière avec juste du code. C'est une claque dont il va falloir tenir compte.

🎬 Tu préfères la version vidéo ?
Cet article est tiré de ma vidéo YouTube — clique pour la voir.
Regarder sur YouTube →🛠️ Outils que tu peux tester en lien avec cet article
Une sélection de mes outils testés, pertinents pour aller plus loin.
🛠️ Tu cherches des outils IA testés ?
J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.
Voir mon annuaire d'outils →



