DAMO Academy publie RynnBrain 1.1, famille embodied 2B à 122B
TL;DR
- La famille RynnBrain 1.1 décline trois échelles (2B, 9B et 122B-A10B), toutes construites sur le backbone Qwen3.5.
- La variante 122B-A10B est annoncée devant Cosmos 3 Super, GPT 5.4 et Claude Sonnet 4.6 sur VSI-Bench, MMSI et MindCube.
- En robotique réelle, RynnBrain-VLA généraliste atteint 94,14 % de process score et 91,67 % de succès, devant GR00T N1.7 et π₀.₅.
Quand une équipe publie un modèle unique qui va d'un 2B pouvant tourner sur du hardware modeste jusqu'à un MoE de 122 milliards de paramètres, la question n'est plus « quel benchmark ils gagnent » mais où ils placent la ligne entre cognition embodied et pilotage moteur. La v1.1 de RynnBrain, publiée le 20 juillet par DAMO Academy (Alibaba) et Hupan Lab sur Hugging Face, essaie de répondre aux deux en même temps.
La famille compte trois échelles, 2B, 9B et 122B-A10B, toutes bâties sur le backbone Qwen3.5. La v1.1 ajoute deux briques par rapport à la 1.0 : la prédiction de point de contact pour la préhension à toutes les échelles, et le grounding 3D natif pour les variantes 2B et 9B, qui produisent directement une bounding box 3D à 9 dimensions (centre, dimensions, orientation) en mètres et radians. Sur VSI-Bench, MMSI et MindCube, la variante 122B-A10B est annoncée à 75,0, 52,0 et 89,6 respectivement, devant Cosmos 3 Super, GPT 5.4 et Claude Sonnet 4.6 dans les tableaux du papier.
Le volet le plus concret est robotique. RynnBrain-VLA se déploie sur trois plateformes hétérogènes, l'humanoïde Unitree G1, le bimanuel Astribot S1 et les mains dextres Tianji-Wuji, via un espace d'action unifié à 81 dimensions avec masquage embodiment-specific. Sur trois tâches réelles, Sprinkle Petals, Pour Wine et Grab Spatulas, évaluées à 20 essais chacune, la politique généraliste atteint 94,14 % de process score et 91,67 % de succès, contre 83,31 % / 73,33 % pour GR00T N1.7 et 72,44 % / 65,0 % pour π₀.₅ selon les mêmes tableaux.
Le passage le plus provocateur du papier n'est pas un score mais une observation d'échelle. Sur les tâches cognitives dites reasoning-intensive, Qwen3.5 régresse de 39,2 % en passant du 2B au 122B, tandis que RynnBrain 1.1 gagne 38,6 %. Autrement dit, à taille égale, plus de langage sans supervision spatio-temporelle dégraderait la performance embodied, et c'est le pré-entraînement embodied qui débloquerait l'utilité de l'échelle. Une revendication forte, à prendre comme un résultat interne, pas comme une loi générale.
L'honnête réserve : 20 essais par tâche, trois plateformes robots précises, et un banc évalué en interne. Ce que le rapport ne dit pas, c'est la licence de publication finale ni si les 2,6 millions d'échantillons de grasp collectés seront diffusés. Ce qu'il montre en revanche, c'est qu'Alibaba a désormais une pile embodied cohérente à opposer aux modèles GR00T et Cosmos ainsi qu'à π₀.₅, et que les intégrateurs qui bâtissent sur Unitree, Astribot ou des mains dextres ont une base commune crédible à évaluer avant de signer chez du propriétaire.
Article original publié par huggingface.co
Lire l'article original →Titre original : DAMO Academy publie RynnBrain 1.1, une famille embodied jusqu'à 122B avec grounding 3D natif