Video-DeepResearch-35B devance Claude 4.5 Sonnet de 5 pts
TL;DR
- Video-DeepResearch-35B-A3B atteint 64,0 % de précision moyenne, devançant Claude 4.5 Sonnet (59,0 %) de 5 points sur les bancs Video-DR.
- La variante 30B affiche 59,3 %, à hauteur de Claude 4.5 Sonnet et devant GPT-5 (52,5 %) comme Gemini 2.5 Pro (57,5 %).
- La recette combine 30k paires VQA synthétisées, 7k trajectoires pour le SFT et 2k instances pour la phase GRPO, sur quatre nœuds H800.
Un papier signé « Video-Deepresearch Team » et publié sur Hugging Face affirme qu'un agent open source de 35B, spécialisé pour la recherche profonde sur flux vidéo, dépasse Claude 4.5 Sonnet sur son propre banc d'essai. Le chiffre marquant : 64,0 % de précision moyenne pour Video-DeepResearch-35B-A3B, contre 59,0 % pour Claude 4.5 Sonnet, 57,5 % pour Gemini 2.5 Pro et 52,5 % pour GPT-5.
Ce qui rend le résultat intéressant, ce n'est pas seulement l'écart de 5 points, c'est la manière d'y arriver. L'équipe part de deux défauts qu'elle a mesurés sur les agents existants. Un biais de modalité d'abord : même le meilleur modèle open source qu'elle a testé, Qwen3.5-397B-A17B, ne déclenche en moyenne que 0,10 appel d'outil visuel par tâche contre 1,27 recherches textuelles, comme s'il évitait activement de regarder les images. Une fuite de connaissances paramétriques ensuite : GPT-5 obtient 57 % sur un banc Video-DR existant en n'appelant quasiment aucun outil, donc en devinant depuis sa mémoire interne plutôt qu'en explorant le web. Leur réponse est un pipeline perception-exploration découplé, où l'agent doit d'abord isoler des images clés et cropper des entités avant de pouvoir toucher aux outils web, entraîné en deux temps : un SFT sur 7k trajectoires curées puis une phase GRPO sur 2k instances de difficulté modérée, le tout sur quatre nœuds NVIDIA H800.
Si la lecture tient, le signal pratique est clair : sur cette tâche précise, la recette de données et les récompenses ciblées comptent davantage que le nombre brut de paramètres. La variante 30B, bâtie sur Qwen3-VL-30B-A3B-Instruct, atteint déjà 59,3 % et fait jeu égal avec Claude 4.5 Sonnet, ce qui donne aux équipes qui déploient sur du hardware ordinaire un point de comparaison ouvert face aux API propriétaires.
Le bémol honnête reste double. D'abord, VideoDR-Bench est conçu et annoté par la même équipe qui l'utilise pour évaluer son propre modèle, ce que le papier assume mais qui invite à attendre des réplications indépendantes avant d'y voir un verdict. Ensuite, le rapport reste muet sur la latence, le coût par requête et la disponibilité publique des poids ; la variante 35B chute par ailleurs à 41,7 % sur la catégorie News, sous le 30B à 58,3 %, signe d'une fragilité sur le contenu temporel dynamique que les auteurs reconnaissent eux-mêmes. La direction à surveiller reste néanmoins celle-ci : les gains les plus intéressants sur les agents multimodaux viennent aujourd'hui de la conception des trajectoires d'entraînement, pas de l'échelle.
Article original publié par huggingface.co
Lire l'article original →Titre original : Video-DeepResearch 35B publiée : 64 % sur VideoDR-Bench, +5 pts sur Claude 4.5 Sonnet