Show-Harness : un simple agent VLM pilote un robot en zero-shot via des unités sémantiques discrètes
Résumé
Show-Harness expose des unités d'action sémantiques discrètes que les VLM raisonnent naturellement, laissées à un interpréteur d'embodiment pour l'exécution physique. Les auteurs (Yanzhe Chen et al., soumission du 9 septembre) transforment ainsi des VLM frontière propriétaires en agents robotiques zero-shot, dépassant les harnesses agentiques et paradigmes VLA de référence. Un module GUMI étend la même interface aux démonstrations sur GUI.
Article original publié par huggingface.co
Lire l'article original →Titre original : Show-Harness : un simple agent VLM pilote un robot en zero-shot via des unités sémantiques discrètes