VideoChat3 : Shanghai AI Lab publie un MLLM vidéo intégralement open source (poids, code, datasets 3M+)
Summary
VideoChat3 est publié le 16 juillet sur Hugging Face avec un tokenizer 3D I3D-ViT, une résolution de frame adaptative pour le streaming et une compression spatiotemporelle 16×. Le modèle 4B surpasse les open sources de tailles comparables sur MotionBench (61,7) et TempCompass (75,6), et divise par deux la latence face à Qwen3-VL sur 2 048 frames. L'équipe libère poids, code d'entraînement, stratégie complète et trois datasets synthétiques (Academic2M, LV116K, OL617K).
Shared on Bluesky by 1 AI expert
-
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding huggingface.co/papers/2607....
View on Bluesky →
Originally reported by huggingface.co
Read the original article →Original headline: VideoChat3 : Shanghai AI Lab publie un MLLM vidéo intégralement open source (poids, code, datasets 3M+)