logo
  • Environnements
  • Entreprise
  • Tarifs
Blogs
Jul 31, 2026

DeepSeek V4 Flash Officiel : Des Benchmarks Agents qui Surpassent V4 Pro Preview

Même architecture, même prix, poids réentraînés — le modèle économique surpasse désormais le flagship preview en agents, avec support natif de l'API Responses et Codex

EigentEigent
Share to
DeepSeek V4 Flash Officiel : Des Benchmarks Agents qui Surpassent V4 Pro Preview
  • Ce qui a RĂ©ellement ChangĂ©
  • Les Chiffres des Benchmarks
  • Pourquoi « MĂŞme Taille, Meilleur Agent » est Important
  • Support de l'API Responses et Codex
  • Ce que Cela Signifie pour Votre Stack
  • Faites-le avec Votre Propre Équipe IA
  • Foire aux Questions
Automate Everything with
AI Workforce on Desktop
Download Eigent

DeepSeek vient de pousser la version officielle de son API V4 Flash en bêta publique — et la nouveauté n'est pas un nouveau modèle, mais un réentraînement. La version, taguée DeepSeek-V4-Flash-0731, conserve exactement la même architecture, la même taille et le même prix que la preview, mais ses scores de benchmarks agents dépassent désormais largement V4-Pro-Preview, le modèle plus grand et plus coûteux de la même famille. Elle ajoute également le support natif de l'API Responses et est adaptée pour Codex. Si vous appelez déjà deepseek-v4-flash, le modèle derrière votre API vient de s'améliorer considérablement, gratuitement.

Ce qui a Réellement Changé

Selon le journal des modifications officiel de l'API DeepSeek, l'API officielle V4 Flash est désormais en bêta publique, et la méthode d'appel est inchangée — vous définissez le nom du modèle sur deepseek-v4-flash exactement comme vous le faisiez pendant la preview. (Journal des modifications DeepSeek)

Trois faits définissent cette version :

  • C'est un rĂ©entraĂ®nement, pas un nouveau modèle. DeepSeek indique que V4-Flash-0731 conserve la mĂŞme architecture et la mĂŞme taille que V4-Flash-Preview et a uniquement Ă©tĂ© rĂ©-post-entraĂ®nĂ©. De nouveaux poids sur le mĂŞme squelette — c'est pourquoi l'intĂ©gration est un changement en remplacement direct. (Journal des modifications DeepSeek)
  • Les chiffres des agents sont l'essentiel. DeepSeek dĂ©crit des « capacitĂ©s agents significativement amĂ©liorĂ©es », avec des rĂ©sultats de benchmarks dĂ©passant largement V4-Pro-Preview. La mise Ă  niveau cible l'exĂ©cution autonome et l'appel d'outils dans des tâches complexes. (Journal des modifications DeepSeek)
  • C'est uniquement pour l'API, pour l'instant. La mise Ă  niveau s'applique uniquement Ă  l'API V4 Flash. L'API V4 Pro et les modèles sur l'application et le site web de DeepSeek sont inchangĂ©s, et DeepSeek indique que la version officielle de V4 Pro suivra bientĂ´t. (Journal des modifications DeepSeek)

Le signal stratégique est ce qui ressort. Pour la majeure partie de la génération V4, la hiérarchie était simple : Pro est puissant, Flash est économique et moins performant. Ce réentraînement renverse cette histoire pour les charges de travail agentiques — le modèle léger affiche désormais des chiffres supérieurs au flagship preview. (TechNode)

Les Chiffres des Benchmarks

DeepSeek a publié un tableau complet de benchmarks avec la version 0731. Ce sont les scores officiels auto-déclarés issus du journal des modifications :

BenchmarkV4-Flash-0731
Terminal Bench 2.182,7
NL2Repo54,2
Cybergym76,7
DeepSWE54,4
Toolathlon (vérifié)70,3
Agent Last Exam25,2
Automation Bench (Public)25,1
DSBench-FullStack68,7
DSBench-Hard59,6

Source : Journal des modifications de l'API DeepSeek. DSBench-FullStack et DSBench-Hard sont les ensembles de tests internes de DeepSeek — respectivement une suite de développement full-stack et une suite d'agents de codage difficile.

Deux mises en garde avant de trop vous fier à la formulation « surpasse V4 Pro Preview » :

  • La comparaison n'est pas parfaitement Ă©quitable. V4-Flash-0731 obtient 82,7 sur Terminal Bench 2.1, tandis que le chiffre V4-Pro-Preview citĂ© dans la couverture mĂ©diatique (67,9) est sur Terminal Bench 2.0 — des versions diffĂ©rentes de l'ensemble de tests, donc une comparaison directe n'est pas totalement juste. (36Kr)
  • Les tâches Code Agent ont utilisĂ© un harnais spĂ©cifique. DeepSeek note que les benchmarks publics Code Agent ont Ă©tĂ© exĂ©cutĂ©s avec son « mode minimal DeepSeek Harness » (pas encore publiĂ©) Ă  effort maximal, top-p 0,95, tempĂ©rature 1,0. Vos chiffres en production dĂ©pendent de votre propre infrastructure. (Journal des modifications DeepSeek)

Néanmoins, l'ampleur est notable : un modèle avec environ 13 milliards de paramètres activés atteignant des scores agents dans cette plage montre à quel point le post-entraînement seul peut faire bouger les choses. (36Kr)

Pourquoi « Même Taille, Meilleur Agent » est Important

V4 Flash est un MoE (Mixture-of-Experts) de 284 milliards de paramètres avec ~13 milliards de paramètres actifs, contre 1,6 billion total / ~49 milliards actifs pour V4 Pro. Les deux partagent une fenêtre de contexte de 1 million de tokens. L'intérêt de Flash était le débit et le coût — vous échangiez certaines capacités contre de la vitesse. (Pour la description complète des spécifications, consultez notre guide DeepSeek V4 Pro.)

En améliorant les performances agents sans modifier le nombre de paramètres, DeepSeek cible exactement le point de douleur que la plupart des équipes rencontrent en production : elles veulent une automatisation à faible coût et haute concurrence mais ne peuvent pas se permettre de faire tourner un flagship de 1,6 billion sur chaque étape d'agent. Un modèle moins cher qui gère bien l'appel d'outils et l'exécution multi-étapes change l'économie de l'exécution d'agents à grande échelle. (BigGo Finance)

Pour quiconque construit des pipelines d'agents, la conclusion pratique est une question de routage : davantage de vos étapes d'agents quotidiennes peuvent désormais utiliser Flash par défaut, avec une escalade vers un modèle plus lourd réservée aux branches véritablement difficiles.

Support de l'API Responses et Codex

L'autre moitié de cette version abaisse la barrière d'intégration. Le V4 Flash officiel supporte nativement le format de l'API Responses et est spécifiquement adapté pour Codex. (Journal des modifications DeepSeek)

C'est important car l'API Responses est le format qu'attendent les nouveaux outils agentiques d'OpenAI — dont Codex. Le support natif signifie que les équipes déjà connectées à un workflow de style Codex peuvent le pointer vers deepseek-v4-flash avec des changements de configuration plutôt qu'une réécriture. DeepSeek indique que l'objectif est d'abaisser la barrière à l'adoption par les développeurs, et les détails de configuration se trouvent dans sa documentation API. (BigGo Finance)

Combiné au fait que l'API V4 est déjà accessible via les interfaces de style ChatCompletions d'OpenAI et de style Anthropic, DeepSeek optimise clairement la compatibilité en remplacement direct à travers les principaux écosystèmes d'agents. (Journal des modifications DeepSeek)

Ce que Cela Signifie pour Votre Stack

Si vous développez sur DeepSeek, voici la version courte :

  • DĂ©jĂ  sur la preview ? Vous bĂ©nĂ©ficiez de la mise Ă  niveau sans changement de code — mĂŞme nom de modèle, mĂŞme prix, meilleur comportement agent. Relancez vos Ă©valuations pour confirmer que l'amĂ©lioration se manifeste sur vos tâches, pas seulement sur les benchmarks publiĂ©s.
  • Vous utilisez des workflows de style Codex ? V4 Flash est dĂ©sormais un vĂ©ritable candidat comme backend moins coĂ»teux, grâce au support natif de l'API Responses et Ă  l'adaptation Codex.
  • Vous attendez V4 Pro ? DeepSeek indique que la version officielle Pro arrive bientĂ´t ; ce rĂ©entraĂ®nement Flash est un avant-goĂ»t des gains de post-entraĂ®nement que vous y verrez probablement aussi.
  • Traitez les benchmarks des fournisseurs comme indicatifs. Les scores sont auto-dĂ©clarĂ©s, certains ensembles sont internes, et la discordance de version de Terminal Bench signifie que la formulation « surpasse Pro Preview » nĂ©cessite un astĂ©risque jusqu'Ă  ce que des Ă©valuations indĂ©pendantes arrivent.

Faites-le avec Votre Propre Équipe IA

Un modèle qui devient à la fois moins cher et meilleur est exactement la raison pour laquelle une plateforme d'agents agnostique au modèle est rentable — vous voulez intégrer le meilleur modèle pour chaque étape sans refactoriser votre architecture. Eigent est une application de bureau multi-agents open-source de type « Cowork » qui orchestre des modèles spécialisés à travers de vrais workflows, vous permettant de router les étapes d'agents routinières vers un modèle rapide et économique comme V4 Flash et d'escalader les branches difficiles ailleurs. Si vous configurez des tâches de codage agentique, découvrez comment Eigent gère des workflows comme la révision de PRs GitHub, ou téléchargez Eigent pour construire votre propre équipe IA localement.

Foire aux Questions

Qu'est-ce que DeepSeek V4 Flash ?

DeepSeek V4 Flash est la variante légère de la famille de modèles V4 de DeepSeek — un modèle Mixture-of-Experts (mélange d'experts) de 284 milliards de paramètres avec environ 13 milliards de paramètres actifs et une fenêtre de contexte de 1 million de tokens, optimisé pour des charges de travail rapides, économiques et à haut débit. L'API officielle (version 0731) est désormais en bêta publique.

Qu'est-ce qui a changé dans la version officielle de V4 Flash ?

La version 0731 conserve la même architecture, la même taille et le même prix que la preview, mais a été ré-post-entraînée, offrant des scores de benchmarks agents significativement plus élevés. Elle ajoute également le support natif de l'API Responses et l'adaptation Codex. La méthode d'appel est inchangée — vous définissez toujours le nom du modèle sur deepseek-v4-flash.

Les benchmarks de V4 Flash surpassent-ils vraiment V4 Pro Preview ?

Les scores agents auto-déclarés de DeepSeek dépassent V4-Pro-Preview sur plusieurs benchmarks. Mais la comparaison n'est pas totalement équitable — par exemple, le score Flash est sur Terminal Bench 2.1 tandis que le score Pro Preview cité est sur Terminal Bench 2.0. Traitez les chiffres comme indicatifs jusqu'à ce que des évaluations indépendantes les confirment.

V4 Flash fonctionne-t-il avec Codex ?

Oui. Le V4 Flash officiel supporte nativement le format de l'API Responses et est spécifiquement adapté pour Codex, de sorte que les workflows de style Codex peuvent l'utiliser comme backend avec des changements de configuration plutôt qu'une réécriture.

V4 Pro bénéficiera-t-il de la même mise à niveau ?

Pas encore. Cette mise à jour s'applique uniquement à l'API V4 Flash. L'API V4 Pro et les modèles d'application et web de DeepSeek sont inchangés, bien que DeepSeek indique que la version officielle de V4 Pro suivra bientôt.

Recent Posts

Grok Bot : Les coéquipiers IA de SpaceXAI qui font de vrai travail
Aug 11, 2026

Grok Bot : Les coéquipiers IA de SpaceXAI qui font de vrai travail

Grok Bot est le nouvel agent IA de SpaceXAI et Cursor—des coéquipiers qui se connectent à vos outils et terminent de vraies tâches. Ce qu'il fait, qui peut l'utiliser, et comment il se compare.

EigentEigent
Grok Bot vs. ChatGPT Work : lequel des deux remporte la bataille des agents IA ?
Aug 11, 2026

Grok Bot vs. ChatGPT Work : lequel des deux remporte la bataille des agents IA ?

Grok Bot vs ChatGPT Work comparés : agents computer-use vs mode exécution, autonomie, connecteurs, tarifs, et quel agent IA convient le mieux à votre équipe.

EigentEigent
Grok Bot vs Claude Cowork: Which AI Coworker Actually Does the Work?
Aug 11, 2026

Grok Bot vs Claude Cowork: Which AI Coworker Actually Does the Work?

Grok Bot vs Claude Cowork compared on computer use, persistent memory, multi-agent teams, pricing, and control — plus the open-source coworker option neither offers.

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

Essayez Eigent dès aujourd’hui

Téléchargez l’application de bureau open source. Votre workforce IA, exécutée sur votre machine.

Télécharger Eigent
Eigent

Recevez les dernières mises à jour, tutoriels et versions sur l’automatisation de la workforce IA.

ProduitEigentEnvironnementsTarifsEntreprise
ExplorerSolutionsCas d’usageCompétencesPluginsBlogs
DéveloppeursDocumentationGitHubCAMEL-AIOpen Source FundPartenaire
TéléchargementPour open source
EntrepriseÀ propos de nousMarqueCarrièresConditions d’utilisationPolitique de confidentialitéSécurité et confiancePolitique relative aux cookiesPolitique de remboursement et d’essai

Tous droits réservés © 2026 EIGENT UK LTD

Nouvelle version d’Eigent 1.0 publiée !download