DeepSeek V4 Flash Officiel : Des Benchmarks Agents qui Surpassent V4 Pro Preview
Même architecture, même prix, poids réentraînés — le modèle économique surpasse désormais le flagship preview en agents, avec support natif de l'API Responses et Codex

DeepSeek vient de pousser la version officielle de son API V4 Flash en bêta publique — et la nouveauté n'est pas un nouveau modèle, mais un réentraînement. La version, taguée DeepSeek-V4-Flash-0731, conserve exactement la même architecture, la même taille et le même prix que la preview, mais ses scores de benchmarks agents dépassent désormais largement V4-Pro-Preview, le modèle plus grand et plus coûteux de la même famille. Elle ajoute également le support natif de l'API Responses et est adaptée pour Codex. Si vous appelez déjà deepseek-v4-flash, le modèle derrière votre API vient de s'améliorer considérablement, gratuitement.
Ce qui a Réellement Changé
Selon le journal des modifications officiel de l'API DeepSeek, l'API officielle V4 Flash est désormais en bêta publique, et la méthode d'appel est inchangée — vous définissez le nom du modèle sur deepseek-v4-flash exactement comme vous le faisiez pendant la preview. (Journal des modifications DeepSeek)
Trois faits définissent cette version :
- C'est un réentraînement, pas un nouveau modèle. DeepSeek indique que V4-Flash-0731 conserve la même architecture et la même taille que V4-Flash-Preview et a uniquement été ré-post-entraîné. De nouveaux poids sur le même squelette — c'est pourquoi l'intégration est un changement en remplacement direct. (Journal des modifications DeepSeek)
- Les chiffres des agents sont l'essentiel. DeepSeek décrit des « capacités agents significativement améliorées », avec des résultats de benchmarks dépassant largement V4-Pro-Preview. La mise à niveau cible l'exécution autonome et l'appel d'outils dans des tâches complexes. (Journal des modifications DeepSeek)
- C'est uniquement pour l'API, pour l'instant. La mise à niveau s'applique uniquement à l'API V4 Flash. L'API V4 Pro et les modèles sur l'application et le site web de DeepSeek sont inchangés, et DeepSeek indique que la version officielle de V4 Pro suivra bientôt. (Journal des modifications DeepSeek)
Le signal stratégique est ce qui ressort. Pour la majeure partie de la génération V4, la hiérarchie était simple : Pro est puissant, Flash est économique et moins performant. Ce réentraînement renverse cette histoire pour les charges de travail agentiques — le modèle léger affiche désormais des chiffres supérieurs au flagship preview. (TechNode)
Les Chiffres des Benchmarks
DeepSeek a publié un tableau complet de benchmarks avec la version 0731. Ce sont les scores officiels auto-déclarés issus du journal des modifications :
| Benchmark | V4-Flash-0731 |
|---|---|
| Terminal Bench 2.1 | 82,7 |
| NL2Repo | 54,2 |
| Cybergym | 76,7 |
| DeepSWE | 54,4 |
| Toolathlon (vérifié) | 70,3 |
| Agent Last Exam | 25,2 |
| Automation Bench (Public) | 25,1 |
| DSBench-FullStack | 68,7 |
| DSBench-Hard | 59,6 |
Source : Journal des modifications de l'API DeepSeek. DSBench-FullStack et DSBench-Hard sont les ensembles de tests internes de DeepSeek — respectivement une suite de développement full-stack et une suite d'agents de codage difficile.
Deux mises en garde avant de trop vous fier à la formulation « surpasse V4 Pro Preview » :
- La comparaison n'est pas parfaitement équitable. V4-Flash-0731 obtient 82,7 sur Terminal Bench 2.1, tandis que le chiffre V4-Pro-Preview cité dans la couverture médiatique (67,9) est sur Terminal Bench 2.0 — des versions différentes de l'ensemble de tests, donc une comparaison directe n'est pas totalement juste. (36Kr)
- Les tâches Code Agent ont utilisé un harnais spécifique. DeepSeek note que les benchmarks publics Code Agent ont été exécutés avec son « mode minimal DeepSeek Harness » (pas encore publié) à effort maximal, top-p 0,95, température 1,0. Vos chiffres en production dépendent de votre propre infrastructure. (Journal des modifications DeepSeek)
Néanmoins, l'ampleur est notable : un modèle avec environ 13 milliards de paramètres activés atteignant des scores agents dans cette plage montre à quel point le post-entraînement seul peut faire bouger les choses. (36Kr)
Pourquoi « Même Taille, Meilleur Agent » est Important
V4 Flash est un MoE (Mixture-of-Experts) de 284 milliards de paramètres avec ~13 milliards de paramètres actifs, contre 1,6 billion total / ~49 milliards actifs pour V4 Pro. Les deux partagent une fenêtre de contexte de 1 million de tokens. L'intérêt de Flash était le débit et le coût — vous échangiez certaines capacités contre de la vitesse. (Pour la description complète des spécifications, consultez notre guide DeepSeek V4 Pro.)
En améliorant les performances agents sans modifier le nombre de paramètres, DeepSeek cible exactement le point de douleur que la plupart des équipes rencontrent en production : elles veulent une automatisation à faible coût et haute concurrence mais ne peuvent pas se permettre de faire tourner un flagship de 1,6 billion sur chaque étape d'agent. Un modèle moins cher qui gère bien l'appel d'outils et l'exécution multi-étapes change l'économie de l'exécution d'agents à grande échelle. (BigGo Finance)
Pour quiconque construit des pipelines d'agents, la conclusion pratique est une question de routage : davantage de vos étapes d'agents quotidiennes peuvent désormais utiliser Flash par défaut, avec une escalade vers un modèle plus lourd réservée aux branches véritablement difficiles.
Support de l'API Responses et Codex
L'autre moitié de cette version abaisse la barrière d'intégration. Le V4 Flash officiel supporte nativement le format de l'API Responses et est spécifiquement adapté pour Codex. (Journal des modifications DeepSeek)
C'est important car l'API Responses est le format qu'attendent les nouveaux outils agentiques d'OpenAI — dont Codex. Le support natif signifie que les équipes déjà connectées à un workflow de style Codex peuvent le pointer vers deepseek-v4-flash avec des changements de configuration plutôt qu'une réécriture. DeepSeek indique que l'objectif est d'abaisser la barrière à l'adoption par les développeurs, et les détails de configuration se trouvent dans sa documentation API. (BigGo Finance)
Combiné au fait que l'API V4 est déjà accessible via les interfaces de style ChatCompletions d'OpenAI et de style Anthropic, DeepSeek optimise clairement la compatibilité en remplacement direct à travers les principaux écosystèmes d'agents. (Journal des modifications DeepSeek)
Ce que Cela Signifie pour Votre Stack
Si vous développez sur DeepSeek, voici la version courte :
- Déjà sur la preview ? Vous bénéficiez de la mise à niveau sans changement de code — même nom de modèle, même prix, meilleur comportement agent. Relancez vos évaluations pour confirmer que l'amélioration se manifeste sur vos tâches, pas seulement sur les benchmarks publiés.
- Vous utilisez des workflows de style Codex ? V4 Flash est désormais un véritable candidat comme backend moins coûteux, grâce au support natif de l'API Responses et à l'adaptation Codex.
- Vous attendez V4 Pro ? DeepSeek indique que la version officielle Pro arrive bientôt ; ce réentraînement Flash est un avant-goût des gains de post-entraînement que vous y verrez probablement aussi.
- Traitez les benchmarks des fournisseurs comme indicatifs. Les scores sont auto-déclarés, certains ensembles sont internes, et la discordance de version de Terminal Bench signifie que la formulation « surpasse Pro Preview » nécessite un astérisque jusqu'à ce que des évaluations indépendantes arrivent.
Faites-le avec Votre Propre Équipe IA
Un modèle qui devient à la fois moins cher et meilleur est exactement la raison pour laquelle une plateforme d'agents agnostique au modèle est rentable — vous voulez intégrer le meilleur modèle pour chaque étape sans refactoriser votre architecture. Eigent est une application de bureau multi-agents open-source de type « Cowork » qui orchestre des modèles spécialisés à travers de vrais workflows, vous permettant de router les étapes d'agents routinières vers un modèle rapide et économique comme V4 Flash et d'escalader les branches difficiles ailleurs. Si vous configurez des tâches de codage agentique, découvrez comment Eigent gère des workflows comme la révision de PRs GitHub, ou téléchargez Eigent pour construire votre propre équipe IA localement.
Foire aux Questions
Qu'est-ce que DeepSeek V4 Flash ?
DeepSeek V4 Flash est la variante légère de la famille de modèles V4 de DeepSeek — un modèle Mixture-of-Experts (mélange d'experts) de 284 milliards de paramètres avec environ 13 milliards de paramètres actifs et une fenêtre de contexte de 1 million de tokens, optimisé pour des charges de travail rapides, économiques et à haut débit. L'API officielle (version 0731) est désormais en bêta publique.
Qu'est-ce qui a changé dans la version officielle de V4 Flash ?
La version 0731 conserve la même architecture, la même taille et le même prix que la preview, mais a été ré-post-entraînée, offrant des scores de benchmarks agents significativement plus élevés. Elle ajoute également le support natif de l'API Responses et l'adaptation Codex. La méthode d'appel est inchangée — vous définissez toujours le nom du modèle sur deepseek-v4-flash.
Les benchmarks de V4 Flash surpassent-ils vraiment V4 Pro Preview ?
Les scores agents auto-déclarés de DeepSeek dépassent V4-Pro-Preview sur plusieurs benchmarks. Mais la comparaison n'est pas totalement équitable — par exemple, le score Flash est sur Terminal Bench 2.1 tandis que le score Pro Preview cité est sur Terminal Bench 2.0. Traitez les chiffres comme indicatifs jusqu'à ce que des évaluations indépendantes les confirment.
V4 Flash fonctionne-t-il avec Codex ?
Oui. Le V4 Flash officiel supporte nativement le format de l'API Responses et est spécifiquement adapté pour Codex, de sorte que les workflows de style Codex peuvent l'utiliser comme backend avec des changements de configuration plutôt qu'une réécriture.
V4 Pro bénéficiera-t-il de la même mise à niveau ?
Pas encore. Cette mise à jour s'applique uniquement à l'API V4 Flash. L'API V4 Pro et les modèles d'application et web de DeepSeek sont inchangés, bien que DeepSeek indique que la version officielle de V4 Pro suivra bientôt.
Recent Posts

Grok Bot : Les coéquipiers IA de SpaceXAI qui font de vrai travail
Grok Bot est le nouvel agent IA de SpaceXAI et Cursor—des coéquipiers qui se connectent à vos outils et terminent de vraies tâches. Ce qu'il fait, qui peut l'utiliser, et comment il se compare.

Grok Bot vs. ChatGPT Work : lequel des deux remporte la bataille des agents IA ?
Grok Bot vs ChatGPT Work comparés : agents computer-use vs mode exécution, autonomie, connecteurs, tarifs, et quel agent IA convient le mieux à votre équipe.

Grok Bot vs Claude Cowork: Which AI Coworker Actually Does the Work?
Grok Bot vs Claude Cowork compared on computer use, persistent memory, multi-agent teams, pricing, and control — plus the open-source coworker option neither offers.