LongE2V : reconstruction, prédiction et interpolation de vidéos événementielles longues via diffusion
Résumé
LongE2V étend les modèles de diffusion vidéo aux séquences événementielles longues, en unifiant reconstruction, prédiction et interpolation dans un seul cadre. Le papier revendique de nouveaux résultats SOTA sur DAVIS-E et EventNFS avec des séquences de plus de 10 secondes issues de caméras événementielles.
Article original publié par huggingface.co
Lire l'article original →Titre original : LongE2V : reconstruction, prédiction et interpolation de vidéos événementielles longues via diffusion