DeepMind sort DiffusionGemma : LLM à diffusion discrète crachant 1 500 tokens/s sur un H100
Résumé
DeepMind a publié DiffusionGemma, un modèle open weights fine-tuné sur Gemma 4 MoE (25,2 Md paramètres totaux, 3,8 Md actifs) qui remplace le décodage autoregressif par un débruitage bloc à bloc de 256 tokens en parallèle. Le pipeline d'entraînement en deux étapes (SFT bidirectionnel puis RL et distillation d'échantillonneur) consomme moins de 10 % des tokens d'entraînement d'origine et débite environ 1 500 tokens/s sur un seul H100, tout en conservant le mode 'thinking', l'entrée multimodale, le long contexte et un mode autoregressif de secours.
Article original publié par huggingface.co
Lire l'article original →Titre original : DeepMind sort DiffusionGemma : LLM à diffusion discrète crachant 1 500 tokens/s sur un H100