Gemma 4 : famille open-weight de 2,3B à 31B avec mode raisonnement
TL;DR
- The Gemma 4 family spans five variants (E2B, E4B, 12B, 26B MoE, 31B) with different per-tier multimodal coverage, giving operators a continuous latency-cost tradeoff from $50 edge boards to server-class GPUs.
- The 12B model eliminates secondary vision and audio encoders entirely, feeding raw patches directly into the LLM backbone and removing the memory overhead that blocked local multimodal inference on standard 16GB enterprise laptops.
- Apache 2.0 licensing without bespoke harmful-use carve-outs is the commercially decisive change: earlier Gemma versions required legal review; this version does not.
L'axe intéressant du rapport technique publié sur arXiv par le Gemma Team n'est pas la taille des modèles, c'est ce qui a été glissé dans une famille open-weight. Gemma 4 couvre 2,3 à 31 milliards de paramètres, en variantes denses et Mixture-of-Experts, et embarque un « thinking mode » qui, selon les auteurs, laisse les modèles produire des traces de raisonnement avant leur réponse.
Le vrai basculement se trouve dans le 12B. Le rapport décrit une architecture unifiée sans encodeur, qui ingère directement les patches d'image et l'audio brut au lieu de passer par des encodeurs séparés. Si la promesse tient, cela rend le multimodal beaucoup plus proche du texte du point de vue d'un développeur : un pipeline à opérer, pas trois modules à orchestrer.
Pourquoi ça compte au-delà de l'arXiv : jusqu'ici, le raisonnement explicite intégré et le multimodal natif étaient l'argument commercial des frontières fermées, facturées par appel API. Une famille open-weight qui revendique un saut sur les benchmarks STEM, long contexte et multimodaux, tout en prétendant rivaliser avec des modèles ouverts plus grands sur des tâches évaluées par humains, change le calcul pour les équipes qui pesaient l'auto-hébergement contre une facture d'API croissante.
L'honnête réserve, c'est que le rapport reste un rapport signé par ses auteurs. Les scores exacts contre les modèles fermés récents, le coût réel du mode raisonnement à l'inférence, et la répartition des paramètres actifs des variantes MoE ne sont pas des choses qu'on peut trancher sans reproduction indépendante. Prenez ce qui est revendiqué comme la position d'un fournisseur, pas comme un verdict.
Ce qu'il faut regarder dans les semaines à venir, c'est qui va effectivement porter le 12B multimodal en production et si le mode raisonnement reste soutenable à petite échelle. Si les deux tiennent, l'écart entre ce qu'on peut auto-héberger et ce qu'on doit louer se resserre encore d'un cran.
Ce qu'en disent les autres médias
-
Google Blog Lire →
Official launch post covers the 150M+ download milestone, Apache 2.0 licensing, nine deployment integrations (vLLM, llama.cpp, Hugging Face, Google Cloud), and a new Gemma Skills repository for agentic workflows.
Bridging the gap between our edge-friendly E4B and our more advanced 26B Mixture of Experts, Gemma 4 12B packages powerful capabilities inside a reduced memory footprint.
-
Google Developers Blog Lire →
Practitioner guide provides working CLI commands, LiteRT-LM on-device serving setup, Apple Silicon GPU support paths, and a video-processing demo showing 5-minute analysis at 1 FPS with audio.
A multimodal encoder-free architecture: Bypassing heavy multi-stage vision and audio encoders entirely, multimodal data is fed straight into the LLM backbone.
-
Google DeepMind Lire →
Product page emphasizes Elo scores rivaling models several times larger, 140-language support, and hardware targets spanning phones, Raspberry Pi, Jetson Nano, and consumer GPUs.
Byte for byte, the most capable open models. Purpose-built for advanced reasoning and agentic workflows.
-
Google AI for Developers Lire →
Model card documents safety evaluation results aligned with Google AI principles, Apache 2.0 legal terms, prohibited-use policies, and benchmark results across 15+ standardized datasets for all five variants.
Gemma 4 models are multimodal, handling text and image input (with audio supported on E2B, E4B, and 12B models) and generating text output.
-
VentureBeat Lire →
Editorial analysis argues the clean Apache 2.0 license without custom harmful-use clauses is the commercially decisive change, above benchmark gains, enabling redistribution and commercial use without legal review.
-
VentureBeat Lire →
Practitioner framing positions Gemma 4 12B as the first open model clearing the 16GB enterprise laptop threshold for native audio-video-text multimodal inference without cloud dependency.
Shared on Bluesky by 2 AI experts
-
Gemma 4 technical report is out! lots of cool stuff, check it out! arxiv.org/abs/2607.02770
View on Bluesky → -
Gus @gusthema.bsky.social: Gemma 4 technical report is out! lots of cool stuff, check it out! arxiv.org/abs/2607.02770 →
Article original publié par arxiv.org
Lire l'article original →Titre original : Google DeepMind publie le rapport technique de Gemma 4 : gamme 2,3B–31B avec architecture unifiée sans encodeur et mode « thinking »