huggingface.co détecté sur le web

LaMem-VLA : Nanjing, Zhejiang et NUS injectent une double mémoire latente dans les modèles Vision-Language-Action pour la manipulation robotique

Robotics Multimodal ai-research

Résumé

LaMem-VLA reconstruit l'expérience historique en tokens de mémoire latente entrelacés directement dans le raisonnement du modèle VLA plutôt qu'en contexte externe. Les auteurs atteignent 73,9 % de succès moyen sur SimplerEnv-Bridge (+16,6 pts vs CogACT) et 97,6 % sur LIBERO grâce à un double vault court terme visuel et long terme sémantique.