Latent Interface Training brise le raccourci vision-action des VLA
TL;DR
- Sur LIBERO-Plus, LIT améliore le taux de succès de 3,87 à 10,70 points selon l'architecture VLA testée.
- En conditions réelles sur trois tâches avec caméras, éclairages et distracteurs inédits, les gains agrégés atteignent 13,30 à 16,70 points.
- La méthode est testée sur quatre architectures existantes : Pi0.5, MolmoAct2, FAST-WAM et ImageWAM, sans modifier leur squelette.
Un papier soumis le 11 septembre 2026 sur arXiv et repris sur Hugging Face s'attaque à un défaut connu des modèles de fondation robotiques : ils fonctionnent en distribution mais se dégradent dès que l'environnement visuel bouge, parce qu'ils ont appris à s'appuyer sur des indices d'image qui corrèlent avec les actions démontrées sans être causaux.
Jianman Lin, Shailesh Shailesh, Zhongyi Luo et Jiafei Duan appellent ce défaut les vision-action shortcuts. Leur méthode, Latent Interface Training (LIT), se déroule en deux temps. Stage 1 entraîne un action expert à générer des chunks d'actions conditionnés sur le langage, l'état du robot et la pose SE(3) terminale de chaque chunk démontré, sans aucune image. Stage 2 ajoute une interface latente qui agrège l'information visuelle et sémantique, et qui est supervisée « to reconstruct the terminal pose previously used to condition Stage 1 ». L'idée est de forcer le canal visuel à ne retenir que l'information spatiale utile à l'action.
Les chiffres publiés dans l'abstract : sur le benchmark LIBERO-Plus, LIT gagne « 3.87-10.70 percentage points » selon l'architecture, tout en préservant ou améliorant le succès moyen sur LIBERO standard. En conditions réelles, agrégé sur trois tâches sous configurations de caméra inédites, variations d'éclairage et distracteurs, les auteurs mesurent « 13.30-16.70 percentage-point gains ». La méthode est testée sur quatre architectures : Pi0.5, MolmoAct2, FAST-WAM et ImageWAM, deux VLA et deux world-action models.
L'abstract ne publie ni chiffres par tâche, ni comparaison directe contre d'autres approches anti-shortcut. Le papier s'inscrit dans une séquence dense côté robotique sur notre tracker, après Show-Harness sur le pilotage zero-shot par VLM la semaine précédente.
Article original publié par huggingface.co
Lire l'article original →Titre original : Latent Interface Training brise le raccourci vision-action des VLA pour des foundation models robotiques