DeepSeek publie V4-Pro-0813 en MIT : MoE de 1,7 T paramètres
TL;DR
- DeepSeek met en ligne V4-Pro-0813 sur Hugging Face, un MoE de 1,7 T paramètres publié sous licence MIT, avec recettes vLLM et SGLang.
- Sur Terminal Bench 2.1 le modèle atteint 87,9 contre 82,7 pour V4-Flash-0731, et DeepSWE passe de 54,4 à 62,7.
- La fiche ne publie ni tarification API, ni fenêtre de contexte, ni nombre de paramètres actifs par forward pass.
Un flagship chinois de plus, mais celui-ci arrive avec la licence permissive dont les DSI rêvent. DeepSeek a mis en ligne sur Hugging Face son modèle V4-Pro-0813, un MoE de 1,7 T paramètres publié sous licence MIT et livré avec les recettes de déploiement pour vLLM et SGLang. C'est un nouvel épisode du feuilleton IA chinoise que nous suivons de près cet été.
Sur les benchmarks agentiques que le labo met en avant, l'écart avec la version Flash sortie en juillet est net : 87,9 sur Terminal Bench 2.1 contre 82,7 pour V4-Flash-0731, 62,7 sur DeepSWE contre 54,4, et 60,0 sur HLE outillé contre 51,5. Sur CyberGym la V4-Pro monte à 83,3 (76,7 pour Flash) et sur Toolathlon-Verified à 74,1. La fiche mise aussi sur le décodage spéculatif maison baptisé DSpark et un cache KV en FP8 pour rendre ce mammouth un peu moins ruineux à servir.
L'intérêt stratégique tient moins à ces gains de cinq à dix points qu'au choix de licence. MIT permet la copie, la modification, la commercialisation et l'usage privé sans clause de partage à l'identique. Pour les équipes qui écartaient DeepSeek pour raison de conformité ou de dépendance fournisseur, un argument tombe. Reste que servir 1,7 T de paramètres, même en MoE, demande une flotte GPU dont la plupart des entreprises ne disposent pas, ce qui laisse le champ ouvert aux hébergeurs tiers façon Together ou Fireworks.
La fiche publiée reste silencieuse sur plusieurs détails que la scène de sortie évoquait. La taille de fenêtre de contexte n'est pas précisée noir sur blanc, aucune grille de prix API n'apparaît, et le nombre de paramètres actifs par forward pass n'est pas indiqué. Les scores de benchmark viennent aussi sans méthodologie détaillée, un rappel qu'un tableau de comparaison signé par le fournisseur mérite toujours d'être rejoué par les équipes qui envisagent de basculer.
Shared on Bluesky by 1 AI expert
-
Sung Kim @sungkim.bsky.social: Here's a placeholder for open-weight. huggingface.co/deepseek-ai/... →
Article original publié par huggingface.co
Lire l'article original →Titre original : DeepSeek publie V4-Pro-0813 en open source MIT : MoE de 1,6 T paramètres et contexte 1 M