← Tous les articles
Modèle IA·6 min de lecture·Par Alan Sharif

Qwen 3.8 Max : Alibaba Vient-Il Vraiment De Rattraper Claude ?

Alibaba vient de sortir Qwen 3.8 Max Preview et la déclaration est osée : ce serait désormais le 2e meilleur modèle au monde, juste derrière Claude Fable 5. Pas de benchmark officiel communiqué, mais des tests indépendants qui vont clairement dans ce sens sur le raisonnement, la programmation et la création d'interfaces visuelles. J'ai voulu vérifier ça moi-même sur mes prompts habituels — architecture, benchmarks, et surtout un vrai test en conditions réelles. Verdict : est-ce qu'Alibaba a vraiment rattrapé Claude ?

Une architecture pensée pour les gros volumes

Qwen 3.8 Max repose sur une architecture mixture of experts : ses 2 400 milliards de paramètres ne sont pas tous activés en même temps pour générer chaque token. En fonction de la demande, le modèle sélectionne seulement les experts les plus pertinents. Rien de nouveau en soi, beaucoup de modèles frontières utilisent ce principe pour construire un modèle gigantesque sans devoir activer l'ensemble du réseau à chaque réponse. Le problème, c'est qu'Alibaba n'a toujours pas communiqué le nombre exact de paramètres actifs — celui qui compte vraiment pour juger la vitesse, le coût réel et la puissance de calcul nécessaire. Pour l'instant, les 2 400 milliards nous donnent surtout une idée de l'échelle du modèle, pas de son efficacité réelle.

La vraie innovation se trouve plutôt dans la gestion des longs contextes. Qwen combine l'attention classique avec un mécanisme appelé gated delta net : au lieu de recalculer sans arrêt les relations entre tous les tokens précédents, le modèle garde un état interne compact qui résume une partie de l'historique, tout en continuant d'utiliser certaines couches d'attention classique quand il a besoin de récupérer une info précise. L'objectif : combiner une mémoire efficace pour les longues séquences avec une capacité à retrouver des détails exacts — utile pour travailler sur des bases de code massives ou de longs documents sans faire exploser la mémoire. Mais une grande fenêtre de contexte ne garantit jamais, à elle seule, que le modèle va bien s'en servir.

Multimodal, et surtout doué en programmation visuelle

Qwen 3.8 Max ne traite pas que du texte : il analyse aussi des images, des vidéos et des documents complexes dans le même workflow. Concrètement, tu peux lui envoyer une capture d'écran, un document et des instructions textuelles, et lui demander de combiner le tout dans sa réponse. Ce qui rend cette multimodalité intéressante pour le développement, c'est que le modèle peut analyser l'apparence d'une interface, comprendre sa structure, puis transformer ce qu'il comprend en action concrète — pas juste décrire une interface, mais la reproduire, l'améliorer ou construire une application fonctionnelle à partir d'une simple référence visuelle.

Et c'est exactement là-dessus que les premiers retours sont les plus impressionnants : Qwen semble particulièrement à l'aise avec le front-end, les animations, les simulations et la structuration visuelle d'une page. Beaucoup de modèles savent aujourd'hui générer du code techniquement correct mais qui produit des interfaces génériques ou mal équilibrées. Qwen, lui, paraît mieux comprendre la relation entre le code et le résultat visible à l'écran — la disposition des éléments, les interactions, l'expérience générale.

Les benchmarks indépendants : un point derrière Fable 5

Sur King Bench, un benchmark centré sur le raisonnement, le code, les tâches visuelles et les workflows agentiques, Qwen obtient 65 points sur 80 — un seul point derrière Claude Fable 5, et devant Claude Sonnet 4.8, Kimi K3 et GPT. À prendre avec des pincettes : le benchmark ne contient qu'un nombre limité d'épreuves et favorise clairement la programmation, le raisonnement technique et la création visuelle. Impossible d'affirmer que Qwen est universellement meilleur que tout ce qui est classé derrière lui, mais ça permet déjà de cerner son profil : un modèle particulièrement performant dès qu'il faut comprendre un problème technique, produire du code, et transformer ce raisonnement en résultat directement utilisable.

Le vrai test : portfolio, jeu de tir à l'arc et scène mésopotamienne

Les benchmarks c'est bien, mais je préfère toujours vérifier sur mes propres prompts. Premier test : transformer une maquette dessinée à la main — un portfolio pour un développeur front-end — en site web moderne. Résultat : header, hero, sections respectées à la lettre, animations fluides, couleurs bien choisies. Complètement validé.

Deuxième prompt, plus exigeant : un jeu de tir à l'arc en 3D, un classique de mes tests qui piège la plupart des modèles sur la position de l'arc. Qwen la place correctement du premier coup, et surtout simule très bien la gravité et la puissance des tirs. La première génération restait un peu basique visuellement, donc je lui ai demandé d'améliorer les graphismes et la jouabilité — la deuxième version change complètement de dimension : scène beaucoup plus vaste, végétation dense, animations plus réalistes. Seul bémol : un problème d'affichage sur les cibles.

Troisième test, mon prompt Forest Robot avec la mascotte de Nerdy Kings — un mini jeu d'aventure 3D où le robot ramasse des pièces en évitant des ours. Mouvements fluides, gestion de caméra propre (rare sur ce prompt, d'habitude la caméra est mal gérée et le jeu devient injouable), et une fonctionnalité inédite : les pièces proches viennent automatiquement au joueur.

Dernier test, mon prompt favori — une scène 3D mésopotamienne inspirée de la civilisation sumérienne. Et là, franchement, rarement vu un résultat aussi impressionnant : architecture variée, palmiers réalistes, un nombre considérable de PNJ qui se déplacent sans faire laguer la scène (ce qui arrive presque à chaque fois avec ce prompt), jeux d'ombre cohérents, ciel qui se couche avec des reflets sur les briques. La ziggourat sumérienne au centre, avec vue sur toute la ville — un des meilleurs rendus que j'ai obtenus sur ce prompt, tous modèles confondus.

Les limites : le temps de réflexion, et l'accès réel au modèle

La plus grande force de Qwen peut aussi devenir son principal défaut. Le modèle utilise un mode thinking particulièrement approfondi, ce qui l'aide à comparer plusieurs approches et anticiper les erreurs sur les problèmes difficiles. Le souci, c'est qu'il ne semble pas toujours savoir quand cette réflexion est réellement nécessaire : sur une tâche simple, il peut continuer à analyser pendant très longtemps avant de produire un résultat. Pour l'utiliser efficacement, mieux vaut donner des consignes très précises — résultat attendu, technologies autorisées, fonctionnalités obligatoires — sinon l'attente peut devenir frustrante.

Le modèle est encore en preview, donc Alibaba va très probablement continuer à le modifier avant la sortie officielle — comportement et performances pourraient évoluer. Alibaba affirme aussi que les poids seront publiés prochainement, mais même en open source, un modèle de cette taille reste largement inaccessible localement pour la majorité des utilisateurs : même fortement compressé, il représenterait plus d'un téraoctet de données, et il faudrait plusieurs GPU professionnels juste pour le faire tourner. Dans les faits, Qwen 3.8 Max restera surtout utilisé via les services cloud d'Alibaba ou des fournisseurs spécialisés.

Mon avis

Qwen 3.8 Max combine plusieurs qualités qui, mises bout à bout, sont vraiment intéressantes : une architecture pensée pour les longs contextes, une compréhension multimodale solide, un raisonnement avancé et de très bonnes capacités de programmation visuelle. Sur mes tests en conditions réelles, il tient clairement la comparaison avec les meilleurs modèles du moment, en particulier sur tout ce qui touche à la création d'interfaces et la transformation de références visuelles en résultats fonctionnels — la scène mésopotamienne à elle seule vaut le détour.

Après, soyons honnêtes : ce n'est pas encore un remplaçant clair de Claude Fable 5. Le temps de réflexion excessif sur des tâches simples reste un vrai défaut d'usage, et sa fiabilité sur des missions longues et totalement autonomes reste à démontrer — un problème qu'on a déjà vu ailleurs, par exemple avec les biais de benchmarks révélés sur DeepSWE. Reste que d'un point de vue purement pratique, Qwen 3.8 Max prouve une fois de plus que la course entre labos chinois et américains — après DeepSeek V4 plus tôt cette année — ne fait clairement que commencer. Un modèle très prometteur, mais encore en preview : à revoir sérieusement dès sa sortie officielle et ses vrais benchmarks.

📤 Partager :
Qwen 3.8 Max : Alibaba Vient-Il Vraiment De Rattraper Claude ?

🎬 Tu préfères la version vidéo ?

Cet article est tiré de ma vidéo YouTube — clique pour la voir.

Regarder sur YouTube →

🛠️ Outils que tu peux tester en lien avec cet article

Une sélection de mes outils testés, pertinents pour aller plus loin.

🛠️ Tu cherches des outils IA testés ?

J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.

Voir mon annuaire d'outils →
Alan Sharif

Alan Sharif — créateur de Nerdy Kings

Je teste les outils IA et je décrypte les nouveaux modèles pour ma communauté de 20 000+ curieux francophones sur YouTube. Sans bullshit, sans hype, sans jargon.