Stanford dévoile HomeBody, humanoïde piloté par GPT Astra
TL;DR
- HomeBody remplace la pile System 2 / System 1 / System 0 par un VLM frontier appelant directement une bibliothèque de skills composables.
- En démonstration, un Unitree G1 piloté par GPT Astra range une cuisine puis récupère un médicament sur instruction sous-spécifiée, sans entraînement dédié à la pièce.
- Le robot explore l'environnement, en construit un jumeau numérique Real2Sim dans Isaac Sim, et s'appuie sur cette mémoire spatiale pour retrouver un objet hors de vue.
HomeBody, présenté par le Movement Lab de Stanford, fait raisonner un VLM frontier directement sur une bibliothèque de skills composables, sans étage d'action appris intermédiaire.
Les auteurs écrivent que « A learned action pipeline connects a System 2 VLM to a System 1 VLA and a System 0 whole-body tracking controller. HomeBody replaces that chain with a plug-and-play VLM calling a composable skill library. » Le système est décrit comme « a system that equips frontier VLMs with persistent spatial memory and composable humanoid skills for long-horizon tasks ».
En démonstration, un Unitree G1 guidé par GPT Astra exécute deux tâches longues dans une cuisine. La première instruction : « Clean up all of the coffee bags and put them in the middle, and throw away all of the milk and orange juice cartons that have gone bad. » La seconde, volontairement sous-spécifiée : « I forgot my medicine, can you get it for me? Also throw out the bad carton while you are at it. » Le robot explore d'abord la pièce, en construit un jumeau numérique Real2Sim dans Isaac Sim, puis s'appuie sur cette mémoire spatiale pour retrouver un objet hors de vue.
Le papier est signé par Gio Huh (Caltech), Cayden Gu et Takara E. Truong (Stanford), avec C. Karen Liu et Guy Tevet (Stanford) comme co-encadrants. Trois chercheurs que nous suivons ont partagé le lien le même jour, dans une séquence de couverture robotique déjà bien fournie ces derniers mois.
La page ne publie ni taux de succès par skill ni comparaison chiffrée avec un pipeline VLA appris. Les auteurs pointent des limites matérielles concrètes : la latence de raisonnement de GPT Astra crée des pauses entre les skills, et les servomoteurs des doigts surchauffent lors d'opérations prolongées.
Shared on Bluesky by 3 AI experts
-
It is strange how much LLMs turned out to be able to solve such a wide range of hard problems that would not, instinctively, seem to be problems that a model of human language would be able to solve This is from a Stanf…
View on Bluesky →
Article original publié par tml.stanford.edu
Lire l'article original →Titre original : Stanford Movement Lab dévoile HomeBody, humanoïde qui explore, mémorise et exécute des tâches longues avec un VLM interchangeable