VideoChat3 : Shanghai AI Lab publie un MLLM vidéo intégralement open source (poids, code, datasets 3M+)
Résumé
VideoChat3 est publié le 16 juillet sur Hugging Face avec un tokenizer 3D I3D-ViT, une résolution de frame adaptative pour le streaming et une compression spatiotemporelle 16×. Le modèle 4B surpasse les open sources de tailles comparables sur MotionBench (61,7) et TempCompass (75,6), et divise par deux la latence face à Qwen3-VL sur 2 048 frames. L'équipe libère poids, code d'entraînement, stratégie complète et trois datasets synthétiques (Academic2M, LV116K, OL617K).
Shared on Bluesky by 1 AI expert
-
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding huggingface.co/papers/2607....
View on Bluesky →
Article original publié par huggingface.co
Lire l'article original →Titre original : VideoChat3 : Shanghai AI Lab publie un MLLM vidéo intégralement open source (poids, code, datasets 3M+)