huggingface.co détecté sur le web

OneStreamer, modèle 4B, domine 8 benchmarks de vidéo en streaming

TL;DR

  • OneStreamer, modèle 4B bâti sur Qwen3-VL-4B-Instruct, dépasse les méthodes comparées sur les huit benchmarks de compréhension vidéo en streaming évalués.
  • Sa Proactive Hierarchical Caption Memory produit des captions time-grounded qui servent de mémoire textuelle réutilisable sans rejouer les features visuelles historiques.
  • Le Proactive State Transition Learning dépasse la supervision dense en ne supervisant que 27,5 % des tokens d'état annotés.

Un modèle 4B revendique les meilleurs résultats sur les huit benchmarks de compréhension vidéo en streaming qu'il affronte, avec une architecture qui enregistre les faits avant même de savoir à quoi ils serviront. OneStreamer, déposé sur arXiv le 1er octobre, est signé par Xiangyu Zeng et vingt-trois co-auteurs, avec le code publié sur GitHub.

Le papier s'attaque à un verrou spécifique : « Streaming video LLMs must retain evidence before its relevance to future tasks is known and respond when sufficient evidence becomes available. » Bâti sur Qwen3-VL-4B-Instruct, le modèle apprend conjointement un enregistrement query-independent et la réponse à la tâche via un même processus de génération proactive.

Deux briques portent la contribution. La Proactive Hierarchical Caption Memory (PHCM) produit « time-grounded local-detail captions and summaries of completed events », une mémoire textuelle réutilisable qui évite de rejouer les features visuelles historiques. Le Proactive State Transition Learning (PSTL) supervise seulement 27,5 % des tokens d'état annotés tout en dépassant la supervision dense, en sélectionnant des tokens représentatifs de changement et de persistance d'état.

Les auteurs livrent aussi OneStreamer-1M, un jeu d'interaction vidéo en streaming de plus d'un million d'enregistrements, assemblé via leur pipeline de synthèse. Les ablations rapportent que « retaining generated captions improves historical QA without degrading real-time perception », argument central de leur thèse d'une génération proactive comme interface d'apprentissage partagée entre perception, mémoire et réponse. Le preprint atterrit le même jour que World Observer de KAIST, deuxième signal fort cette semaine côté world models et agents vidéo en continu.