technode.com détecté sur le web

DeepSeek passe V4-Flash-0731 en beta publique côté agents

5 médias qui couvrent ce sujet

TL;DR

  • V4-Flash-0731 scores 82.7 on Terminal Bench 2.1, up from 61.8 in preview, clearing V4-Pro-Preview at 72.1 with no architectural changes.
  • The upgrade is re-post-training only: same 284B total / 13B active MoE weights, making capability gains a training-methods story, not a scale story.
  • OfficeChai notes the release landed one day after OpenAI cut GPT-5.6 Luna prices 80%, framing both moves as a real-time price war on agentic inference.

DeepSeek a poussé son API V4-Flash en beta publique ce 31 juillet, avec une signature 0731 qui ne touche ni l'architecture ni le nombre de paramètres du preview, mais rejoue le post-training pour ramasser des points sur les tâches d'agents. Selon TechNode, le modèle passe à 82,7 sur Terminal Bench 2.1, contre 61,8 pour la preview, et à 54,4 sur DeepSWE, en gardant la même structure et la même taille.

Le détail qui compte pour les équipes produits est ailleurs. L'API expose nativement le format Responses et reste compatible Codex. Autrement dit, un outil déjà câblé sur OpenAI peut pointer sur DeepSeek sans shim, sans wrapper maison, sans réécrire la boucle d'appels d'outils. Combiné à un tarif de 0,28 $ par million de tokens en sortie et à une concurrence annoncée de 2 500 en beta, cela donne un remplaçant crédible pour les workflows d'agents à volume, là où le coût d'inférence a été jusqu'ici le principal frein.

Le sous-texte est plus inconfortable pour les flagships payants que pour les autres challengers. Un modèle léger à 13 milliards de paramètres actifs, dans un MoE de 284 milliards au total, qui dépasse sur plusieurs benchmarks le propre V4-Pro-Preview de DeepSeek (49 milliards actifs) attaque frontalement l'idée que la capacité d'agent exige un modèle haut de gamme. Et parler Codex sans traduction, c'est cibler exactement les intégrations où les concurrents s'appuyaient jusqu'ici sur un moat d'usage autant que de performance.

La mise en garde honnête, c'est que la bascule ne concerne que l'API V4-Flash: V4-Pro, l'application grand public et le web ne bougent pas, donc l'utilisateur final ne verra rien changer. Et ce que le papier ne dit pas, c'est la fiabilité mesurée sur des sessions agent longues en production, la latence médiane, ni la date à laquelle l'API sortira de beta avec les SLA qui vont avec.

Pour un builder d'agents qui cherchait un endpoint moins cher sans reprendre son code d'orchestration, la fenêtre s'est ouverte cette semaine.

Ce qu'en disent les autres médias

Couverture consolidée 2h après publication

  1. DeepSeek (Official) Lire →

    First-party changelog with full benchmark table: Terminal Bench 2.1 (82.7), NL2Repo (54.2), Responses API specs, and calling method confirmation.

    Significantly enhanced agent capabilities, with benchmark results far exceeding V4-Pro-Preview.
  2. Artificial Analysis Lire →

    Independent cross-model benchmarking across nine evals including GDPval-AA v2, SciCode and GPQA Diamond; ranks the model #1 price, #2 intelligence among 25 peers.

    Scores 50 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 17).
  3. OfficeChai Lire →

    Contextualizes the release against OpenAI's 80% GPT-5.6 Luna price cut the day before, framing it as a coordinated or reactive pricing-war move.

    V4-Flash-0731 is priced at $0.14 per million input tokens on a cache miss, $0.0028 on a cache hit, and $0.28 per million output tokens.
  4. AlphaSignal Lire →

    Leads with the efficiency story: substantial benchmark gains through re-post-training alone signal that training methods now matter more than parameter scale for agentic tasks.

    The upgrade is post-training only: same 284B total / 13B active MoE architecture, no new weights.