huggingface.co détecté sur le web

Nanbeige publie un 3B agentique qui bat Qwen3.5-9B en SWE-Bench

TL;DR

  • Nanbeige4.2-3B affiche 63,6 % sur SWE-Bench Verified, devant Qwen3.5-9B (53,1 %) et Gemma4-12B (44,2 %), pour 3 Md de paramètres non-embedding.
  • L'architecture Looped Transformer réutilise les couches pour gonfler la capacité sans ajouter de paramètres, avec une variante LoopSplit prévue pour Nanbeige4.5.
  • Le modèle reste en retrait sur l'alignement pur: 54,6 % sur IF-Bench contre 73,5 % pour Gemma4-12B, et 63,3 % vs 69,4 % sur Recruit-Bench.

Un modèle de 3 milliards de paramètres non-embedding qui coiffe des modèles trois à quatre fois plus gros sur du code agentique, c'est le genre de résultat qui mérite qu'on regarde de plus près comment il est construit. Nanbeige LLM Lab vient de publier Nanbeige4.2-3B sur Hugging Face sous licence Apache 2.0, avec des scores qui, s'ils tiennent en pratique, déplacent un peu la frontière du "petit modèle vraiment utile".

Les chiffres publiés par le laboratoire: 63,6 % sur SWE-Bench Verified, contre 53,1 % pour Qwen3.5-9B et 44,2 % pour Gemma4-12B. Sur SWE-Bench Pro, l'écart reste net, 46,9 % contre 33,8 % et 21,9 %. Terminal-Bench 2.0 suit la même pente, 44,1 % contre 29,2 % et 21,1 %. Le levier revendiqué est architectural: un Looped Transformer qui réutilise les couches pour augmenter la capacité effective sans gonfler le nombre de paramètres. La fiche annonce aussi des briques déjà intégrées et destinées à Nanbeige4.5, entraînement en cours pour "plus tard en 2026": LoopSplit, mHC avec attention en profondeur, et embeddings n-gram concaténés.

Ce qui rend l'histoire intéressante au-delà du leaderboard, c'est le format. Un modèle de cette taille tient en local avec des quantisations pour llama.cpp, Ollama, LM Studio et Jan, et se sert via vLLM ou SGLang. Autrement dit, un agent codeur crédible peut cesser d'être un appel API pour devenir un binaire sur poste de travail, ce qui change le calcul coût-latence pour les équipes qui automatisent des revues, du refactor ou du triage de bugs.

L'honnête bémol tient en deux points. D'abord, le modèle est en retrait sur l'instruction-following: 54,6 % sur IF-Bench contre 73,5 % pour Gemma4-12B, et 63,3 % vs 69,4 % sur Recruit-Bench. Un agent qui code bien mais suit moins fidèlement les consignes peut casser dans les workflows longs. Ensuite, ce que la fiche ne donne pas: budget de calcul d'entraînement, composition détaillée des données SFT et RL, mesures indépendantes de latence, et gains chiffrés attendus de LoopSplit. Les scores viennent du laboratoire, pas d'un tiers.

Si Nanbeige4.5 confirme la trajectoire d'ici la fin d'année, la pression retombe sur les autres suites open compactes — Qwen, Gemma, Llama — pour livrer des 3-4B agentiques du même calibre, et sur les fournisseurs d'API code pour justifier leur premium face à un binaire local sous Apache 2.0.