DeepSeek passe V4-Flash-0731 en beta publique côté agents
TL;DR
- Post-training alone lifted Terminal Bench 2.1 from 61.8 to 82.7 and DeepSWE from 7.3 to 54.4, clearing V4-Pro on all nine agent benchmarks.
- At $0.14/M input tokens, V4-Flash-0731 undercuts GPT-5.6 Sol ($5), Claude Sonnet 5 ($3), and Claude Fable 5 ($10) by an order of magnitude.
- V4-Flash-0731 is the only DeepSeek product with native Responses API and Codex integration; V4-Pro support is scheduled for August.
DeepSeek a poussé son API V4-Flash en beta publique ce 31 juillet, avec une signature 0731 qui ne touche ni l'architecture ni le nombre de paramètres du preview, mais rejoue le post-training pour ramasser des points sur les tâches d'agents. Selon TechNode, le modèle passe à 82,7 sur Terminal Bench 2.1, contre 61,8 pour la preview, et à 54,4 sur DeepSWE, en gardant la même structure et la même taille.
Le détail qui compte pour les équipes produits est ailleurs. L'API expose nativement le format Responses et reste compatible Codex. Autrement dit, un outil déjà câblé sur OpenAI peut pointer sur DeepSeek sans shim, sans wrapper maison, sans réécrire la boucle d'appels d'outils. Combiné à un tarif de 0,28 $ par million de tokens en sortie et à une concurrence annoncée de 2 500 en beta, cela donne un remplaçant crédible pour les workflows d'agents à volume, là où le coût d'inférence a été jusqu'ici le principal frein.
Le sous-texte est plus inconfortable pour les flagships payants que pour les autres challengers. Un modèle léger à 13 milliards de paramètres actifs, dans un MoE de 284 milliards au total, qui dépasse sur plusieurs benchmarks le propre V4-Pro-Preview de DeepSeek (49 milliards actifs) attaque frontalement l'idée que la capacité d'agent exige un modèle haut de gamme. Et parler Codex sans traduction, c'est cibler exactement les intégrations où les concurrents s'appuyaient jusqu'ici sur un moat d'usage autant que de performance.
La mise en garde honnête, c'est que la bascule ne concerne que l'API V4-Flash: V4-Pro, l'application grand public et le web ne bougent pas, donc l'utilisateur final ne verra rien changer. Et ce que le papier ne dit pas, c'est la fiabilité mesurée sur des sessions agent longues en production, la latence médiane, ni la date à laquelle l'API sortira de beta avec les SLA qui vont avec.
Pour un builder d'agents qui cherchait un endpoint moins cher sans reprendre son code d'orchestration, la fenêtre s'est ouverte cette semaine.
Ce qu'en disent les autres médias
-
OfficeChai Lire →
Tracks full benchmark progression (61.8 to 82.7 on Terminal Bench; 7.3 to 54.4 on DeepSWE) and directly compares Flash pricing against Sol, Claude Sonnet 5, and Claude Fable 5.
V4-Flash-0731 is a training and post-training upgrade, not a new model, keeping the same architecture and parameter count as preview.
-
MarkTechPost Lire →
Adds self-hosting infrastructure specifics (110GB VRAM at 3-bit or a 4xGB300 node) and flags that all benchmarks are vendor-reported on an unreleased harness with no external verification.
Same 284B/13B architecture as the April preview: the jump is post-training only.
-
ByteIota Lire →
Details Codex integration mechanics, the single-line migration path from preview to production, and flags China-server data sovereignty risks for GDPR and HIPAA workloads.
V4-Flash-0731 keeps the same model architecture and size as V4-Flash-Preview, and was only re-post-trained.
-
XenoSpectrum Lire →
Reports that peak-hour pricing doubles DeepSeek rates, making Flash potentially more expensive than GPT-5.6 Luna under congestion, and ties cheap API pricing to large infrastructure contracts.
Article original publié par technode.com
Lire l'article original →Titre original : DeepSeek passe V4-Flash-0731 en public beta avec 82,7 sur Terminal Bench 2.1 et une API Responses compatible Codex