huggingface.co détecté sur le web

OpenBMB publie MiniCPM-RobotManip, VLA 1,5 Md à 120 ms/pas

TL;DR

  • MiniCPM-RobotManip est une politique Vision-Language-Action généraliste de 1,5 milliard de paramètres publiée en Apache-2.0 sur Hugging Face.
  • OpenBMB revendique une latence de forward de 120 ms par pas sur H100 en BF16, contre 234 ms attribués à π0.5.
  • La compression visuelle 256→64 tokens et l'inférence streaming ramènent la compute par pas de 125 à 3,3 TFLOPs en gardant 60 images.

Une nouvelle publication sur Hugging Face vaut le détour moins pour la taille du modèle que pour ce qu'OpenBMB prétend en tirer. Le laboratoire met en ligne MiniCPM-RobotManip, une politique Vision-Language-Action généraliste de 1,5 milliard de paramètres, sous licence Apache-2.0, avec la revendication de battre des modèles plus gros comme π0.5 et Qwen-VLA sur des évaluations dites représentatives.

L'angle intéressant n'est pas le classement lui-même, c'est la mécanique invoquée pour y arriver. La fiche modèle décrit une compression visuelle héritée de MiniCPM-V 4.6 qui ramène chaque image de 256 à 64 tokens, un facteur 4. Combinée à un contexte en streaming, la compute par pas de décision passerait de 125 TFLOPs à 3,3 TFLOPs tout en gardant 60 images d'historique, soit jusqu'à une minute de mémoire visuelle. Sur un H100 en BF16 avec entrée mono-image, OpenBMB annonce une latence de forward de 120 ms par pas contre 234 ms pour π0.5.

Pour les équipes robotiques, la promesse concrète est double, un même jeu de poids qui vise à couvrir plusieurs embodiments via un paramètre embodiment_id, et un coût par pas suffisamment bas pour tenir une longue fenêtre visuelle sans exploser la facture GPU. Le tout est publié en Apache-2.0, ce qui autorise l'usage commercial et l'intégration sans négociation de licence, un point non trivial dans un domaine où beaucoup de VLA restent derrière des APIs propriétaires.

Le bémol honnête est que ces chiffres viennent d'OpenBMB elle-même, avec des benchmarks internes présentés en image (manip_benchmark.png) plutôt qu'en tableau chiffré, et que la mesure de latence, précise la fiche, exclut le décodage autorégressif de la tâche. Ce que le dépôt ne donne pas, ce sont les taux de succès par tâche de manipulation, la composition détaillée des données d'entraînement multi-embodiment, ni la latence bout-en-bout une fois la génération du chunk d'actions (30, 80) intégrée.

Reste que si les évaluations tiennent hors du banc du constructeur, l'écart de coût par pas rebat les cartes pour les laboratoires qui essaient de faire tourner un VLA sérieux sur du matériel accessible plutôt que sur des clusters dédiés.