← Tous les articles
Architecture·6 min de lecture·Par Alan Sharif

DeepSeek MHC : Adieu Les Transformers ? (Nouvelle Archi)

Depuis l'avènement des Transformers et de ChatGPT, la règle c'était la force brute : ajouter des paramètres, des GPU, des données. Mais cette méthode coûte une fortune, demande une énergie colossale et commence à montrer ses limites. On arrive clairement à un plafond de verre. C'est là que DeepSeek vient de publier une bombe architecturale : le MHC (Manifold-Constrained Hyper Connections). Derrière ce terme un peu barbare se cache une idée qui pourrait rendre obsolètes les manières actuelles de construire les IA.

Le goulot d'étranglement des architectures actuelles

GPT-4, Llama 3 et compagnie reposent tous sur une colonne vertébrale inventée en 2015 : la connexion résiduelle (ResNet). Imaginez le flux d'information dans une IA comme une autoroute. Dans un modèle classique, cette autoroute n'a qu'une seule voie — le residual stream. À chaque couche, l'IA prend l'info, la traite et la remet sur cette voie unique. Tout passe par là : syntaxe, faits historiques, raisonnement mathématique.

Problème : sur des problèmes complexes, cette voie unique sature. C'est l'embouteillage. Le modèle est obligé de compresser des infos contradictoires dans le même espace vectoriel. C'est le goulot d'étranglement de la largeur.

La solution intuitive qui ne marchait pas

Élargir l'autoroute. Au lieu d'une voie, en mettre 4, 10 ou 100 en parallèle — les hyper connexions. Sur le papier, brillant. En pratique, jusqu'à aujourd'hui, échec total.

Pourquoi ? Quand vous multipliez les voies sans contrôle strict, vous créez du bruit. Chaque couche amplifie un peu le signal, et avec des centaines de couches, l'amplification devient exponentielle. Les chercheurs de DeepSeek ont mesuré le phénomène : dans un réseau à hyper-connexion classique, le signal est amplifié par un facteur de 3000 à la sortie. C'est gigantesque. L'information utile est noyée, les valeurs explosent. C'est le stability gap. Résultat : l'entraînement crash et produit du grand n'importe quoi.

Le polytope de Birkhoff : dompter le chaos avec de la géométrie

DeepSeek n'a pas abandonné l'idée des voies multiples. "Le problème, c'est pas d'avoir plusieurs voies. Le problème, c'est l'anarchie qui y règne." Ils ont imposé une contrainte mathématique très forte : forcer les matrices qui gèrent ces échanges à vivre sur une surface géométrique précise — le polytope de Birkhoff.

Pas besoin de doctorat en topologie pour comprendre. L'idée est élégante : imposer une règle de double stochasticité :

  1. La somme de toutes les valeurs sur une ligne doit être égale à 1.
  2. La somme de toutes les valeurs sur une colonne doit être égale à 1.

C'est une loi de conservation parfaite. L'information peut se mélanger, changer de voie, être redistribuée — mais elle ne peut pas grossir artificiellement. L'énergie totale du système reste constante.

Grâce à cette cage géométrique, DeepSeek a réduit l'amplification du signal de 3000× à seulement 1,6×. C'est la différence entre un bruit assourdissant et une symphonie parfaitement claire. Ils ont stabilisé un réseau ultra large là où tout le monde échouait depuis des années.

Le défi de l'implémentation : zero cost

Avoir la belle équation, c'est la moitié du chemin. Le vrai défi : faire tourner ça sur des GPU. Pour forcer les matrices à respecter la double stochasticité, il faut un algorithme itératif appelé Sinkhorn-Knopp. Si vous le codiez naïvement en PyTorch, votre IA serait peut-être intelligente — mais incroyablement lente.

DeepSeek a descendu au niveau le plus bas de la programmation, avec leur propre langage Tile Language, pour faire de la fusion de kernels. Au lieu de demander au GPU de faire "calcule, écris en mémoire, relis, divise, écris", ils ont fusionné toutes ces opérations (y compris Sinkhorn) en une seule méga-instruction. Tout se passe dans les registres du processeur, sans passer par la case mémoire lente.

Résultat : implémenter cette architecture coûte seulement 6,7% de temps supplémentaire par rapport à un modèle basique. C'est ce qu'ils appellent le Zero Cost Implementation.

Dual Pipe : saturer les GPU

Pour entraîner ce monstre de 27 milliards de paramètres, ils ont aussi réinventé la façon dont les données traversent les serveurs avec une techno appelée Dual Pipe. Dans un entraînement classique, il y a des "bulles" — des moments où le GPU attend les données et ne fait rien. Avec Dual Pipe, les données circulent dans les deux sens simultanément à travers le réseau de cartes graphiques. Le pipeline est bidirectionnel. Ça permet de saturer les GPU à 100% et de contourner les restrictions matérielles que DeepSeek subit (notamment les sanctions US sur les puces).

Les résultats

Sur des modèles de taille moyenne, MHC surclasse les architectures traditionnelles. Le gain le plus spectaculaire est dans le raisonnement logique et mathématique : +7 points sur GSM8K par rapport à un modèle standard de même taille.

Pourquoi un tel gain en logique ? Parce que grâce aux hyper-connexions, l'IA peut enfin séparer les tâches. Certaines voies stockent des connaissances encyclopédiques, d'autres effectuent du raisonnement pur. Les informations ne se marchent plus dessus. On passe d'un cerveau qui essaie de tout faire en même temps à un cerveau organisé par comportements spécialisés.

Mon avis

Ce que DeepSeek nous montre avec MHC, c'est que la course à l'IA n'est plus seulement une course à la taille — c'est une course à l'architecture. Pendant que beaucoup empilent des couches, DeepSeek a regardé le problème sous l'angle de la topologie et de l'efficacité. Ils ont prouvé qu'on peut briser le plafond de verre des Transformers en étant plus malin mathématiquement et plus rigoureux techniquement. Cette innovation est peut-être le signe avant-coureur de la prochaine génération d'IA : des modèles pas forcément plus gros, mais infiniment mieux câblés.

📤 Partager :
DeepSeek MHC : Adieu Les Transformers ? (Nouvelle Archi)

🎬 Tu préfères la version vidéo ?

Cet article est tiré de ma vidéo YouTube — clique pour la voir.

Regarder sur YouTube →

🛠️ Outils que tu peux tester en lien avec cet article

Une sélection de mes outils testés, pertinents pour aller plus loin.

🛠️ Tu cherches des outils IA testés ?

J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.

Voir mon annuaire d'outils →
Alan Sharif

Alan Sharif — créateur de Nerdy Kings

Je teste les outils IA et je décrypte les nouveaux modèles pour ma communauté de 20 000+ curieux francophones sur YouTube. Sans bullshit, sans hype, sans jargon.