huggingface.co détecté sur le web

VideoChat3 : Shanghai AI Lab publie un MLLM vidéo intégralement open source (poids, code, datasets 3M+)

video generation open source multimodal research open-source

Résumé

VideoChat3 est publié le 16 juillet sur Hugging Face avec un tokenizer 3D I3D-ViT, une résolution de frame adaptative pour le streaming et une compression spatiotemporelle 16×. Le modèle 4B surpasse les open sources de tailles comparables sur MotionBench (61,7) et TempCompass (75,6), et divise par deux la latence face à Qwen3-VL sur 2 048 frames. L'équipe libère poids, code d'entraînement, stratégie complète et trois datasets synthétiques (Academic2M, LV116K, OL617K).

Shared on Bluesky by 1 AI expert

  • Evangelos Kazakos @ekazakos.bsky.social amplified

    @dmitryontech.bsky.social

    VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding huggingface.co/papers/2607....

    View on Bluesky →