ViDiHand : les modèles de diffusion vidéo transformés en reconstructeur 4D de mouvement des mains
Résumé
NTU Singapore et SJTU dévoilent ViDiHand, première méthode à exploiter les modèles de diffusion vidéo pré-entraînés (Wan2.1-VACE) pour la reconstruction 4D du mouvement des deux mains à partir de vidéo égocentrique. Performance record sur ARCTIC (99,7 % de précision de détection contre 91,9 %, MPJPE divisé par 4), avec une généralisation cross-dataset démontrée. Une étape vers le passage à l'échelle de la collecte de données pour l'IA incarnée.
Article original publié par huggingface.co
Lire l'article original →Titre original : ViDiHand : les modèles de diffusion vidéo transformés en reconstructeur 4D de mouvement des mains