← Tous les articles
Multimodal·6 min de lecture·Par Alan Sharif

Gemma 4 12B : Un Seul Transformer Pour Voir, Entendre Et Raisonner

Quand vous envoyez une image à une intelligence artificielle et que vous lui demandez ce qu'elle voit, on pourrait penser que le modèle regarde directement l'image, un peu comme nous. En réalité, ça n'a jamais fonctionné comme ça. Et Google DeepMind vient de proposer une approche radicalement différente avec Gemma 4 12B : un modèle multimodal qui n'a quasiment plus besoin de système spécialisé pour lui expliquer ce qu'il voit ou ce qu'il entend.

Comment une IA multimodale fonctionne normalement

À la base, un modèle de langage reste un modèle de langage : il reçoit des tokens, des morceaux de texte transformés en nombres. Si vous écrivez "il y a un chat sur la table", aucun problème, le modèle sait traiter cette information. Mais si vous lui donnez directement la photo d'un chat, ça coince : une image, ce sont des pixels, et un modèle de langage n'a aucune idée de quoi faire avec ça.

La solution traditionnelle consiste à placer un autre réseau neuronal devant lui. Pour les images, on utilise typiquement un vision transformer : son travail est d'analyser l'image et d'en extraire des caractéristiques compréhensibles. Un adaptateur transforme ensuite ces informations dans un format compatible avec le modèle de langage — un peu comme un traducteur entre un spécialiste de la vision et un cerveau qui raisonne. Pour l'audio, même logique : on ajoute un encodeur spécialisé qui traite le signal sonore avant de transmettre le résultat au modèle principal.

Ça fonctionne très bien. Mais au final, votre IA "multimodale" ressemble surtout à une petite équipe de réseaux neuronaux spécialisés connectés les uns aux autres, plutôt qu'à un seul cerveau unifié.

Schéma de l'architecture multimodale classique : une image passe par un vision transformer puis un adaptateur avant d'arriver dans le modèle de langage (LLM)
L'architecture multimodale classique : l'image est « traduite » par un spécialiste avant d'arriver au modèle de langage.

Gemma 4 : la fin des encodeurs spécialisés

C'est exactement là que Gemma 4 12B change de philosophie, en proposant quelque chose de beaucoup plus radical : supprimer carrément ces encodeurs spécialisés.

Prenons une image. Au lieu de l'envoyer dans un énorme réseau dédié à la vision, Gemma commence par la découper en petits carrés, ce qu'on appelle des patchs — imaginez une photo découpée comme une mosaïque. Chaque morceau contient les valeurs RGB des pixels présents à cet endroit. Et c'est là qu'arrive la partie intéressante : ces valeurs sont projetées mathématiquement, directement dans la dimension interne utilisée par le modèle, avec un système qui indique où se trouvait chaque morceau dans l'image d'origine.

Ensuite, c'est quasiment tout. Ces représentations sont envoyées directement dans le Transformer principal. Il n'y a plus de gros modèle de vision chargé de "regarder" l'image avant lui : c'est le modèle principal lui-même qui doit apprendre à comprendre ce qu'il reçoit. Concrètement, au lieu d'avoir un spécialiste qui analyse l'image puis transmet le résultat au cerveau, on donne directement les morceaux de l'image au cerveau et on lui dit : débrouille-toi avec ça.

Une image découpée en patchs RGB : chaque petit carré garde ses valeurs de pixels avant d'être projeté directement dans le transformer de Gemma 4
Une image, c'est une mosaïque de patchs — chaque carré garde ses valeurs RGB.

Le son suit exactement le même chemin

Pour l'audio, le principe est identique. Le signal sonore est découpé en toutes petites tranches de 40 millisecondes. Chaque tranche contient les valeurs du signal à cet instant, et ces informations sont elles aussi projetées dans l'espace utilisé par le modèle avant d'arriver directement dans le Transformer.

Résultat : le texte arrive dans le Transformer, l'image arrive dans le Transformer, l'audio arrive aussi dans le Transformer — et c'est ce même réseau qui doit progressivement apprendre les relations entre tout ça. Si vous lui montrez suffisamment d'images de chien associées au mot "chien", le modèle doit apprendre lui-même que certaines configurations de pixels correspondent à ce concept. Pareil pour la parole : le Transformer doit apprendre que certaines structures dans le signal sonore correspondent à certains sons, certains mots, et finalement certaines significations.

La frontière entre percevoir et raisonner s'efface

Cette architecture est fascinante parce qu'elle brouille une séparation qu'on considérait presque comme acquise. Normalement, on pourrait grossièrement découper le travail en trois : un réseau qui voit, un autre qui écoute, et un LLM qui raisonne sur les informations qu'on lui transmet. Avec Gemma 4, une grande partie de ce travail se retrouve directement dans le même Transformer. Le cerveau devient, en quelque sorte, également les yeux et les oreilles.

Texte, image et audio entrent tous dans le même transformer Gemma 4, qui alimente un agent capable de voir, entendre et raisonner
Texte, image, audio : tout entre dans le même transformer, qui devient à la fois les yeux, les oreilles et le cerveau.

Et forcément, supprimer ces réseaux spécialisés permet aussi de supprimer énormément de paramètres. Dans l'architecture décrite par DeepMind, le gros encodeur visuel — qui aurait pu représenter environ 550 millions de paramètres — est remplacé par un module d'intégration beaucoup plus petit. Côté audio, on se débarrasse également d'un encodeur spécialisé de plusieurs centaines de millions de paramètres.

Est-ce que ça tient vraiment la route ?

Tout ça, c'est génial sur le papier, mais un encodeur visuel spécialisé reste extrêmement puissant lorsqu'il faut extraire des détails complexes d'une image. Face à des documents très denses, des textures très proches ou des scènes particulièrement compliquées, cette simplification peut avoir des limites.

Ce qui est impressionnant, c'est que malgré cette architecture beaucoup plus simple, Gemma 4 12B conserve de solides capacités multimodales. Et il ne faut pas voir cette idée uniquement comme une manière d'économiser quelques centaines de millions de paramètres : ce qui compte, c'est surtout la philosophie derrière. Gemma 4 12B montre qu'on peut construire des modèles multimodaux suffisamment petits pour tourner en local, sur du matériel grand public — 12 milliards de paramètres, donc largement à la portée d'un bon PC.

On retrouve ici une tendance qu'on observe aussi chez certains laboratoires chinois comme DeepSeek : arrêter de simplement empiler toujours plus de paramètres, et chercher à rendre les modèles plus efficaces.

Pourquoi ça compte vraiment pour les agents IA

C'est particulièrement intéressant pour les agents IA. Un agent doit pouvoir lire du texte, regarder une interface, comprendre des images ou de l'audio, puis agir. Si toutes ces informations peuvent être traitées directement par le même Transformer, on obtient une architecture beaucoup plus unifiée — particulièrement adaptée aux futurs agents qui devront tourner en local, sans dépendre en permanence d'un datacenter.

Ça ne veut pas dire que tous les modèles vont abandonner leurs encodeurs spécialisés : ce genre d'architecture garde d'énormes avantages, notamment pour les cas les plus exigeants en précision visuelle. Mais l'expérience prouve une chose : on peut prendre un seul cerveau, lui donner du texte, des pixels, du son, et le forcer à apprendre à comprendre tout ça par lui-même.

Mon avis

Soyons honnêtes : sur le papier, "supprimer les encodeurs spécialisés" ressemble à une simplification un peu risquée. Mais c'est justement ce qui me plaît dans ce que fait DeepMind ici. Ce n'est pas juste un exercice d'optimisation pour gratter quelques benchmarks — c'est un vrai pari architectural : est-ce qu'un seul réseau peut vraiment apprendre à voir, entendre et raisonner, sans qu'on lui prémâche le travail ? Et la réponse, à 12 milliards de paramètres seulement, est étonnamment oui.

Ce qui m'intéresse le plus, ce n'est même pas Gemma 4 en lui-même, c'est la direction que ça dessine : des modèles multimodaux assez légers pour tourner sur ta machine, sans dépendre d'un cloud à chaque requête. Pour des agents IA capables de lire ton écran et d'agir en local, ce genre d'architecture unifiée, ça change beaucoup de choses. À prendre avec des pincettes sur les cas d'usage les plus exigeants — mais la tendance, elle, est claire.

📤 Partager :
Gemma 4 12B : Un Seul Transformer Pour Voir, Entendre Et Raisonner

🎬 Tu préfères la version vidéo ?

Cet article est tiré de ma vidéo YouTube — clique pour la voir.

Regarder sur YouTube →

🛠️ Outils que tu peux tester en lien avec cet article

Une sélection de mes outils testés, pertinents pour aller plus loin.

🛠️ Tu cherches des outils IA testés ?

J'ai testé plus de 20 outils IA en vidéo — résumé, mode d'emploi, mon verdict.

Voir mon annuaire d'outils →
Alan Sharif

Alan Sharif — créateur de Nerdy Kings

Je teste les outils IA et je décrypte les nouveaux modèles pour ma communauté de 20 000+ curieux francophones sur YouTube. Sans bullshit, sans hype, sans jargon.