DeepMind lance Gemini Robotics 2 pour piloter l'humanoïde Apollo
TL;DR
- DeepMind lance trois modèles Gemini Robotics 2: un VLA de contrôle corps entier, un ER 2 de raisonnement embarqué et un On-Device 2 adaptable localement.
- Sur l'humanoïde Apptronik Apollo 2, le VLA atteint 76.3% de succès en préhension sur étagère et 89.6% en insertion précise sur Franka Duo.
- Gemini Robotics ER 2 est accessible sur Google AI Studio et en preview privée sur Gemini Enterprise Agent Platform depuis le 30 juillet 2026.
Il y a un détail dans l'annonce de Gemini Robotics 2 qui vaut plus que le titre marketing: le modèle pilote désormais un humanoïde entier, des pieds aux doigts, et non plus seulement le haut du corps sur une table. Dans le billet publié par DeepMind, Carolina Parada présente trois modèles distincts qui composent la nouvelle génération: un VLA de contrôle moteur, un modèle de raisonnement embarqué baptisé ER 2, et une variante On-Device 2 pensée pour tourner localement sur le robot.
Les chiffres publiés donnent une lecture honnête du niveau réel. Sur l'humanoïde Apptronik Apollo 2 équipé des mains Inspire, le VLA atteint 76.3% de succès pour saisir un objet sur une étagère, 68.4% sur une table, et 45.7% au sol. Sur les tâches de dextérité fine avec la main SharpaWave à cinq doigts et 22 degrés de liberté, l'écart entre gestes est marqué: 92% pour dévisser une ampoule, 36% seulement pour la revisser, 40% sur un sachet ziplock. Sur la plateforme bi-bras Franka Duo, l'insertion précise monte à 89.6%.
Ce qui rend l'annonce intéressante pour un opérateur, c'est le découpage. ER 2 joue le cerveau haut niveau: il décompose l'instruction en plusieurs minutes d'actions, coordonne le VLA, suit la progression et détecte quand appeler un humain. La variante On-Device 2 s'adapte à un nouveau corps de robot, y compris avec des capteurs et morphologies très différents comme Dexmate, SO101 ou Trossen, avec quelques heures de données et typiquement moins de 200 exemples. DeepMind ouvre ER 2 en preview sur Google AI Studio et sur Gemini Enterprise Agent Platform, tandis que le VLA et le On-Device restent réservés à des partenaires early-access.
Le caveat honnête tient dans les taux eux-mêmes: 45.7% de succès sur une préhension au sol n'est pas un modèle prêt pour l'usine, et le billet ne dit rien sur la latence embarquée, le coût par appel, ni la répartition entre données simulées et données réelles récoltées sur robot. DeepMind introduit aussi un benchmark maison, ASIMOV-Agentic, pour mesurer si l'agent sait refuser un appel d'outil dangereux et détecter la proximité humaine, mais l'évaluation reste faite par l'auteur du modèle.
Ce qu'il faut retenir pour la suite: les constructeurs d'humanoïdes qui n'ont pas leur propre pile logicielle fondation gagnent un socle capable, au prix d'une dépendance croissante à l'écosystème Google Cloud. Le prochain signal utile ne sera pas un benchmark de plus, mais la première ligne pilote qui tourne une journée entière sur ce stack.
Shared on Bluesky by 1 AI expert
Article original publié par deepmind.google
Lire l'article original →Titre original : Google DeepMind sort Gemini Robotics 2 et prend le contrôle des humanoïdes des pieds aux doigts