huggingface.co détecté sur le web

TurboVLA fait tourner un VLA à 32 Hz sur RTX 4090 grand public

TL;DR

  • TurboVLA atteint 97,7 % de succès moyen sur le benchmark LIBERO avec seulement 0,2 milliard de paramètres selon ses auteurs.
  • Le modèle affiche 31,2 ms de latence et 0,9 Go de VRAM sur une RTX 4090 grand public, soit environ 32 Hz.
  • L'équipe HUST-Huawei retire le grand modèle de langage central du pipeline VLA au profit d'un mapping direct V+L→A.

Le geste intéressant, dans le papier publié sur Hugging Face, n'est pas la course au meilleur score sur LIBERO mais le fait de retirer purement et simplement le grand modèle de langage du chemin entre perception et action. L'équipe issue de Huazhong University of Science and Technology et de Huawei propose TurboVLA, qui remplace le pipeline habituel V→L→A par un mapping direct V+L→A.

Concrètement, un encodeur visuel et un petit encodeur texte de type BERT traitent séparément l'image et l'instruction, un module compact d'interaction bidirectionnelle échange l'information entre les deux, et un décodeur prédit des chunks d'actions continus en une seule passe. Les auteurs annoncent 97,7 % de succès moyen sur le benchmark LIBERO, avec 0,2 milliard de paramètres, 31,2 ms de latence de bout en bout et 0,9 Go de VRAM sur une RTX 4090 grand public, soit environ 32 Hz. Le modèle représente, selon eux, environ 6 % du nombre de paramètres de π0.5.

Pourquoi cela compte quand on ne construit pas soi-même de VLA : jusqu'ici, tourner en boucle fermée un modèle vision-langage-action à fréquence utile supposait des cartes de datacenter et des budgets qui excluent la plupart des laboratoires et des startups. Faire descendre l'empreinte sous 1 Go de VRAM sur du matériel de joueur change le calcul, en particulier pour les bras robotiques mobiles ou les plateformes embarquées où chaque milliseconde et chaque watt comptent.

L'honnête réserve est que les chiffres viennent d'un seul papier des auteurs, non encore corroborés par des équipes indépendantes, et que l'évaluation en réel se limite à une plateforme AgileX Piper et quatre tâches simples de table (attraper un rouleau, déplacer une carte, presser une agrafeuse, empiler trois bols), chacune sur 40 essais. Ce que le papier n'aborde pas encore : comment le retrait de la colonne vertébrale LLM affecte la généralisation à des instructions ou à des scènes très éloignées de l'entraînement.

Si l'idée tient au-delà de LIBERO, elle rebat les cartes pour qui veut déployer de la manipulation conditionnée par le langage sans dépendre d'un cluster : startups robotiques, laboratoires universitaires, projets open source. La vraie question à surveiller sera moins le prochain point de pourcentage sur le benchmark que la reproductibilité et la robustesse hors distribution.