deepmind.google via Hacker News

DeepMind lance Gemini Robotics 2 pour piloter l'humanoïde Apollo

6 médias qui couvrent ce sujet

TL;DR

  • Gemini Robotics 2 collapses separate locomotion and manipulation stacks into one VLA policy, the first system to govern a full humanoid end-to-end.
  • Google put ER 2 in the Gemini API on launch day, claiming the physical AI infrastructure layer before rivals achieve whole-body control.
  • Google's own data shows 92% success on lightbulb unscrewing but only 32-44% on ziplock seals and trash bag tying.

Il y a un détail dans l'annonce de Gemini Robotics 2 qui vaut plus que le titre marketing: le modèle pilote désormais un humanoïde entier, des pieds aux doigts, et non plus seulement le haut du corps sur une table. Dans le billet publié par DeepMind, Carolina Parada présente trois modèles distincts qui composent la nouvelle génération: un VLA de contrôle moteur, un modèle de raisonnement embarqué baptisé ER 2, et une variante On-Device 2 pensée pour tourner localement sur le robot.

Les chiffres publiés donnent une lecture honnête du niveau réel. Sur l'humanoïde Apptronik Apollo 2 équipé des mains Inspire, le VLA atteint 76.3% de succès pour saisir un objet sur une étagère, 68.4% sur une table, et 45.7% au sol. Sur les tâches de dextérité fine avec la main SharpaWave à cinq doigts et 22 degrés de liberté, l'écart entre gestes est marqué: 92% pour dévisser une ampoule, 36% seulement pour la revisser, 40% sur un sachet ziplock. Sur la plateforme bi-bras Franka Duo, l'insertion précise monte à 89.6%.

Ce qui rend l'annonce intéressante pour un opérateur, c'est le découpage. ER 2 joue le cerveau haut niveau: il décompose l'instruction en plusieurs minutes d'actions, coordonne le VLA, suit la progression et détecte quand appeler un humain. La variante On-Device 2 s'adapte à un nouveau corps de robot, y compris avec des capteurs et morphologies très différents comme Dexmate, SO101 ou Trossen, avec quelques heures de données et typiquement moins de 200 exemples. DeepMind ouvre ER 2 en preview sur Google AI Studio et sur Gemini Enterprise Agent Platform, tandis que le VLA et le On-Device restent réservés à des partenaires early-access.

Le caveat honnête tient dans les taux eux-mêmes: 45.7% de succès sur une préhension au sol n'est pas un modèle prêt pour l'usine, et le billet ne dit rien sur la latence embarquée, le coût par appel, ni la répartition entre données simulées et données réelles récoltées sur robot. DeepMind introduit aussi un benchmark maison, ASIMOV-Agentic, pour mesurer si l'agent sait refuser un appel d'outil dangereux et détecter la proximité humaine, mais l'évaluation reste faite par l'auteur du modèle.

Ce qu'il faut retenir pour la suite: les constructeurs d'humanoïdes qui n'ont pas leur propre pile logicielle fondation gagnent un socle capable, au prix d'une dépendance croissante à l'écosystème Google Cloud. Le prochain signal utile ne sera pas un benchmark de plus, mais la première ligne pilote qui tourne une journée entière sur ce stack.

Ce qu'en disent les autres médias

Couverture consolidée 24h après publication

  1. Bloomberg Lire →

    Bloomberg leads with dexterity shortfalls rather than the architectural milestone, foregrounding the gap between lab performance and real-world deployment.

  2. Engadget Lire →

    Directly contrasts Google's 'fully autonomous' demonstration with Tesla Optimus's reliance on teleoperators, placing the launch in competitive context.

    "it's another milestone in our path towards really getting towards what we call like physical AGI" — Carolina Parada, Google DeepMind
  3. The Next Web Lire →

    Pairs honest performance data (92% on bulbs, 40% on ziplock) with a geopolitical frame: the US ban on Chinese robots concentrates Google's partner network on Western hardware makers.

    "Our goal is to bring AI into the physical world and then build the intelligence layer that can be used by every robot" — Carolina Parada, DeepMind
  4. SiliconANGLE Lire →

    Focuses on mid-task error recovery via continuous video feedback and tool-calling to external cloud services, adding technical depth absent from most announcement coverage.

    "By watching continuous video feeds, robots can now track their own progress, adapt if something goes wrong, and know exactly when to move on."
  5. Robotics & Automation News Lire →

    Written for a robotics-specialist audience; details the Apollo 2 and Sharpa hands hardware stack, all three model variants, and the ASIMOV-Agentic safety benchmark.

    "Gemini Robotics 2 extends previous work by adding whole-body control, enabling humanoids to coordinate movements from feet to fingertips."

Shared on Bluesky by 2 AI experts