← Tous les articles
Architecture·6 min de lecture·Par Alan Sharif

Nvidia Nemotron Two Tower : 2,4x Plus Rapide, Mais À Quel Prix ?

Début juillet, Nvidia a publié une architecture appelée Nemotron Two Tower, avec une promesse simple : rendre un modèle de langage environ 2,4 fois plus rapide, sans repartir de zéro ni sacrifier l'essentiel de ses capacités. Sauf qu'en creusant les chiffres, on découvre une facture qu'on ne vous vend pas dans le titre : pour accélérer un modèle, Nvidia doit pratiquement en charger deux en mémoire. Voici ce qui se cache derrière ce 2,4x.

Le changement de philosophie derrière ce papier

Pendant des années, les laboratoires américains ont surtout cherché à construire des modèles toujours plus gros, entraînés sur toujours plus de données, avec toujours plus de GPU. Mais depuis quelques mois, DeepSeek pousse une approche différente : obtenir davantage avec la même base, grâce à l'architecture, à la compression et à l'optimisation de l'inférence — on en parlait déjà avec Dual Path et DSpark. Et ce papier Nvidia s'inscrit exactement dans cette logique : au lieu de prédire uniquement le token suivant, un modèle apprend à en anticiper plusieurs à la fois.

Comment fonctionne Two Tower

La majorité des modèles de langage actuels génèrent le texte de manière autorégressive : le modèle produit un token, puis utilise ce token pour calculer le suivant. Il doit terminer l'étape 9 avant de commencer l'étape 10. C'est très fiable, surtout pour le code ou les mathématiques, parce que chaque décision s'appuie sur tout ce qui a déjà été validé. On peut comparer ça à une machine à écrire extrêmement rapide, mais qui doit toujours taper les touches une par une.

Pour un chatbot classique, ce n'est pas dramatique — le texte est de toute façon généré plus vite qu'on ne peut le lire. Mais pour un agent qui appelle un modèle des dizaines de fois, utilise un outil, lit le résultat, réfléchit et recommence, quelques secondes perdues à chaque étape transforment vite une tâche simple en workflow interminable.

C'est là que Nvidia entre en jeu. Nemotron Two Tower repose sur Nemotron 3 Nano 30B-A3B, un modèle hybride qui mélange Mamba, attention classique et Mixture of Experts. Nvidia duplique cette base en deux tours : la tour de contexte, qui lit la requête et garde une représentation propre de tout ce qui a déjà été généré, et la tour de débruitage, qui apprend à générer plusieurs tokens en parallèle. L'image la plus simple, c'est celle d'un écrivain qui connaît parfaitement le chapitre déjà validé, et d'un correcteur qui reçoit le paragraphe suivant sous forme de 16 emplacements vides à remplir en même temps.

Le modèle de base avait été pré-entraîné sur environ 25 milliards de tokens. Nvidia n'a pas recommencé cet entraînement colossal : l'entreprise a gelé la première tour et n'a entraîné que la seconde, sur environ 2,1 milliards de tokens. Au début de chaque bloc, le modèle crée 16 positions masquées ; la tour de débruitage essaie de les prédire simultanément, en regardant dans les deux directions à l'intérieur du bloc. Les positions encore incertaines sont remasquées et recalculées à l'itération suivante, jusqu'à ce que les 16 positions soient remplies. Le système reste donc autorégressif à l'échelle des blocs, mais parallèle à l'intérieur de chaque bloc.

2,42x plus vite, mais pas sur tout

Dans la configuration testée par Nvidia — des blocs de 16 tokens sur deux GPU H100 — Two Tower génère le texte environ 2,42 fois plus vite que la version autorégressive de base, avec 98,7% de la qualité globale conservée selon Nvidia. Sur MMLU, le score bouge à peine : 78,56 pour la version classique contre 78,24 pour Two Tower. En revanche, sur HumanEval (code Python), le score passe d'environ 79,3 à 75,6, et les mathématiques perdent également quelques points.

Ça s'explique assez bien : pour les tâches qui exigent une séquence extrêmement rigoureuse comme le code ou les maths, la génération parallèle laisse passer davantage de petites erreurs. Dans un programme, une seule parenthèse ou le choix entre une boucle et une condition change immédiatement tous les tokens suivants. Nvidia permet d'ailleurs de revenir à un mode purement autorégressif quand la précision compte plus que la vitesse.

La contrainte qu'on ne peut pas dépasser

Le modèle est entraîné pour travailler avec des blocs de 16 tokens, et c'est une limite dure. Avec des blocs de 64 tokens, HumanEval s'effondre autour de 20% et GSM8K tombe presque à zéro. Le parallélisme fonctionne, mais uniquement dans une fenêtre très contrôlée — ce n'est pas un bouton qu'on peut pousser à volonté pour aller encore plus vite.

La vraie facture : la taxe matérielle

Et c'est là que le titre accrocheur cache l'essentiel. Chaque tour contient le poids d'un modèle d'environ 30 milliards de paramètres. Même si seulement quelques milliards sont actifs à chaque token grâce au Mixture of Experts, les deux jeux de poids doivent rester chargés en mémoire. En pleine précision, le système demande environ 138 Go de VRAM, sur une configuration officielle à deux H100. C'est assez ironique : l'architecture réduit le temps de génération, mais elle double presque la quantité de poids à stocker. Et le chiffre de 2,42x décrit une configuration précise et bien optimisée — rien ne garantit qu'un utilisateur lambda obtiendra ce résultat sur son propre matériel.

Pour qui ça change vraiment la donne

Pour un chat classique, afficher 16 tokens par saccade n'est pas forcément plus agréable qu'un streaming fluide mot par mot. Le vrai potentiel est ailleurs : dans les agents. Un agent qui doit effectuer 30 appels au modèle pour terminer une tâche voit chaque petit gain de latence se répéter 30 fois — et devenir très visible. Avec une accélération proche de 2,4x, certains workflows pourraient passer de plusieurs minutes à un temps beaucoup plus acceptable. En revanche, pour écrire du code sensible, résoudre des mathématiques complexes ou servir des milliers de requêtes simultanées dans le cloud, l'avantage est nettement moins évident.

Mon avis

Honnêtement, je ne pense pas que Two Tower soit le futur universel des modèles de langage. La taxe matérielle est vraiment trop élevée, et la baisse de performance en code montre que la génération token par token va être très dure à remplacer, surtout quand une précision séquentielle absolue est nécessaire.

Mais ce papier reste intéressant pour une raison qui dépasse largement Nvidia : ça veut dire que les labos américains adoptent enfin une autre philosophie. Arrêter de faire toujours plus gros, et commencer à optimiser ce qu'on a déjà — exactement ce que DeepSeek répète depuis six mois. Alors la vraie question, ce n'est pas de savoir si Two Tower va remplacer l'autorégressif partout. C'est de savoir combien de temps encore les géants américains vont mettre à réaliser que la course à la taille a ses limites, pendant que d'autres optimisent déjà ce qui existe.

📤 Partager :
NVIDIA Revolutionizes LLM Architecture: 2.4× Faster

🎬 Tu préfères la version vidéo ?

Cet article est tiré de ma vidéo YouTube — clique pour la voir.

Regarder sur YouTube →

🛠️ Outils que tu peux tester en lien avec cet article

Une sélection de mes outils testés, pertinents pour aller plus loin.

🛠️ Tu cherches des outils IA testés ?

J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.

Voir mon annuaire d'outils →
Alan Sharif

Alan Sharif — créateur de Nerdy Kings

Je teste les outils IA et je décrypte les nouveaux modèles pour ma communauté de 20 000+ curieux francophones sur YouTube. Sans bullshit, sans hype, sans jargon.