logo
  • 环境
  • 企业版
  • 价格
Blogs
Jul 31, 2026

DeepSeek V4 Flash 正式发布:智能体基准测试超越 V4 Pro Preview

相同架构、相同价格、重新训练的权重——这款低价模型在智能体任务上已超越预览版旗舰,并原生支持 Responses API 和 Codex

EigentEigent
Share to
DeepSeek V4 Flash 正式发布:智能体基准测试超越 V4 Pro Preview
  • 究竟发生了哪些变化
  • 基准测试数据
  • "规模不变、智能体能力更强"为何重要
  • Responses API 与 Codex 支持
  • 对您的技术栈意味着什么
  • 用您自己的 AI 工作团队来实践
  • 常见问题
Automate Everything with
AI Workforce on Desktop
Download Eigent

DeepSeek 刚刚将其 V4 Flash API 的正式版推入公开测试阶段——这次发布的亮点并非全新模型,而是一次重新训练。此次构建版本标记为 DeepSeek-V4-Flash-0731,与预览版保持完全相同的架构、规模和价格,但其智能体基准测试分数现已大幅超越同系列中规模更大、价格更高的 V4-Pro-Preview。此外,该版本还新增了原生 Responses API 支持,并适配了 Codex。如果您已在调用 deepseek-v4-flash,您 API 背后的模型刚刚免费获得了显著提升。

究竟发生了哪些变化

根据 DeepSeek 官方 API 更新日志,V4 Flash 官方 API 现已进入公开测试阶段,调用方式保持不变——您只需将模型名称设置为 deepseek-v4-flash,与预览期间完全一致。(DeepSeek 更新日志)

此次发布有三个核心事实:

  • 这是重新训练,而非全新模型。 DeepSeek 表示,V4-Flash-0731 保留了与 V4-Flash-Preview 相同的架构和规模,仅进行了后训练(post-training)阶段的重新训练。相同骨架上的新权重——这也是为何集成只需直接替换即可。(DeepSeek 更新日志)
  • 智能体数据才是核心看点。 DeepSeek 描述了"显著增强的智能体能力",基准测试结果大幅超越 V4-Pro-Preview。此次升级重点针对复杂任务中的自主执行和工具调用能力。(DeepSeek 更新日志)
  • 目前仅限 API 端。 此次升级仅适用于 V4 Flash API。V4 Pro API 以及 DeepSeek 应用和网站上的模型均未变化,DeepSeek 表示 V4 Pro 正式版将很快跟进发布。(DeepSeek 更新日志)

最值得关注的是其战略信号。在 V4 系列的大部分时间里,层级关系很简单:Pro 性能强,Flash 价格低但能力较弱。这次重新训练颠覆了智能体工作负载的这一格局——轻量级模型的测试分数现已超越预览版旗舰。(TechNode)

基准测试数据

DeepSeek 随 0731 构建版本发布了完整的基准测试表格。以下是更新日志中官方自报的分数:

基准测试V4-Flash-0731
Terminal Bench 2.182.7
NL2Repo54.2
Cybergym76.7
DeepSWE54.4
Toolathlon(已验证)70.3
Agent Last Exam25.2
Automation Bench(公开版)25.1
DSBench-FullStack68.7
DSBench-Hard59.6

来源:DeepSeek API 更新日志。DSBench-FullStack 和 DSBench-Hard 是 DeepSeek 的内部测试集——分别为全栈开发套件和高难度编程智能体套件。

在过度解读"超越 V4 Pro Preview"这一说法之前,有两点需要注意:

  • 对比并非完全同等条件。 V4-Flash-0731 在 Terminal Bench 2.1 上得分 82.7,而相关报道中引用的 V4-Pro-Preview 数据(67.9)来自 Terminal Bench 2.0——两者是不同版本的测试集,因此直接比较并不完全公平。(36Kr)
  • 代码智能体任务使用了特定测试框架。 DeepSeek 指出,公开代码智能体基准测试使用其"DeepSeek Harness 最小模式"(尚未发布)以最大努力、top-p 0.95、temperature 1.0 运行。您在生产环境中的实际数据取决于您自己的脚手架配置。(DeepSeek 更新日志)

尽管如此,这一幅度仍然值得关注:一个激活参数量约为 130 亿的模型能在智能体任务上取得这样的分数,充分说明了后训练阶段单独能带来多大的提升空间。(36Kr)

"规模不变、智能体能力更强"为何重要

V4 Flash 是一个总参数量 2840 亿的混合专家(MoE)模型,激活参数约 130 亿,而 V4 Pro 的总参数量为 1.6 万亿,激活参数约 490 亿。两者均共享 100 万 token 的上下文窗口。Flash 的核心价值在于吞吐量和成本——您以部分能力换取了速度。(完整规格对比,请参阅我们的 DeepSeek V4 Pro 指南。)

在不改变参数量的情况下提升智能体性能,DeepSeek 正在精准击中大多数团队在生产环境中遇到的痛点:他们需要低成本、高并发的自动化能力,但又无法在每个智能体步骤上都运行 1.6 万亿参数的旗舰模型。一个能够良好处理工具调用和多步骤执行的低成本模型,将从根本上改变大规模运行智能体的经济账。(BigGo Finance)

对于构建智能体流水线的开发者而言,实际结论是一个路由策略:更多日常智能体步骤现在可以默认使用 Flash,仅在真正困难的分支上才升级到更重量级的模型。

Responses API 与 Codex 支持

此次发布的另一半内容降低了集成门槛。官方 V4 Flash 原生支持 Responses API 格式,并专门适配了 Codex。(DeepSeek 更新日志)

这一点至关重要,因为 Responses API 是 OpenAI 新一代智能体工具(包括 Codex)所期望的格式。原生支持意味着已接入 Codex 风格工作流的团队,只需通过配置更改即可将其指向 deepseek-v4-flash,而无需重写代码。DeepSeek 表示,其目标是降低开发者的采用门槛,具体配置详情可在其 API 文档中查阅。(BigGo Finance)

结合 V4 API 已同时支持 OpenAI 风格的 ChatCompletions 和 Anthropic 风格接口这一事实,DeepSeek 显然正在针对主流智能体生态系统优化其即插即用的兼容性。(DeepSeek 更新日志)

对您的技术栈意味着什么

如果您基于 DeepSeek 进行开发,以下是简要总结:

  • 已在使用预览版? 无需任何代码更改即可获得升级——相同的模型名称、相同的价格、更强的智能体表现。重新运行您的评估,确认改进在您的任务上同样有效,而不仅仅是已发布的基准测试。
  • 运行 Codex 风格的工作流? 得益于原生 Responses API 支持和 Codex 适配,V4 Flash 现在是作为低成本后端的有力候选。
  • 等待 V4 Pro? DeepSeek 表示官方 Pro 版本即将发布;这次 Flash 的重新训练是您在 Pro 上也可能看到的后训练收益的预演。
  • 将厂商基准测试视为方向性参考。 这些分数均为自报数据,部分测试集为内部数据集,且 Terminal Bench 版本不一致意味着"超越 Pro Preview"的说法需要打上星号,直到独立评估结果出炉。

用您自己的 AI 工作团队来实践

模型变得更便宜同时性能更强,这正是选择模型无关的智能体平台物有所值的原因——您希望为每个步骤接入最合适的模型,而无需重新设计架构。Eigent 是一款开源的多智能体"协作"桌面应用,可跨真实工作流编排专业化模型,让您将常规智能体步骤路由到 V4 Flash 这样快速、低成本的模型,并在困难分支上升级到其他模型。如果您正在搭建智能体编程任务,可以了解 Eigent 如何处理审查 GitHub PR 等工作流,或下载 Eigent 在本地构建您自己的 AI 工作团队。

常见问题

DeepSeek V4 Flash 是什么?

DeepSeek V4 Flash 是 DeepSeek V4 模型系列的轻量级变体——一个总参数量 2840 亿的混合专家(MoE)模型,激活参数约 130 亿,上下文窗口为 100 万 token,专为快速、低成本、高吞吐量工作负载而优化。官方 API(0731 构建版本)现已进入公开测试阶段。

V4 Flash 正式版有哪些变化?

0731 构建版本保留了与预览版相同的架构、规模和价格,但经过了重新后训练,带来了显著更强的智能体基准测试分数。此外还新增了原生 Responses API 支持和 Codex 适配。调用方式保持不变——您仍将模型名称设置为 deepseek-v4-flash。

V4 Flash 的基准测试真的超越了 V4 Pro Preview 吗?

DeepSeek 自报的智能体分数在多项基准测试上超越了 V4-Pro-Preview。但对比并非完全同等条件——例如,Flash 的分数来自 Terminal Bench 2.1,而引用的 Pro Preview 分数来自 Terminal Bench 2.0。在独立评估结果确认之前,请将这些数据视为方向性参考。

V4 Flash 能与 Codex 配合使用吗?

可以。官方 V4 Flash 原生支持 Responses API 格式,并专门适配了 Codex,因此 Codex 风格的工作流只需通过配置更改即可将其用作后端,无需重写代码。

V4 Pro 会获得同样的升级吗?

暂时不会。此次更新仅适用于 V4 Flash API。V4 Pro API 以及 DeepSeek 应用和网页版模型均未变化,但 DeepSeek 表示官方 V4 Pro 版本将很快跟进发布。

Recent Posts

Grok Bot:SpaceXAI 的 AI 队友,真正完成实际工作
Aug 11, 2026

Grok Bot:SpaceXAI 的 AI 队友,真正完成实际工作

Grok Bot 是 SpaceXAI 和 Cursor 推出的全新 AI 智能体——能登录你的工具并完成真实工作的 AI 队友。了解它的功能、适用人群及产品对比。

EigentEigent
Grok Bot vs. ChatGPT Work:哪个智能体 AI 工作团队更胜一筹?
Aug 11, 2026

Grok Bot vs. ChatGPT Work:哪个智能体 AI 工作团队更胜一筹?

Grok Bot vs ChatGPT Work 深度对比:计算机操控智能体 vs 执行模式、自主性、连接器、定价,以及哪款智能体 AI 工作团队更适合你的团队。

EigentEigent
Grok Bot vs Claude Cowork:哪个 AI 同事真正能完成工作?
Aug 11, 2026

Grok Bot vs Claude Cowork:哪个 AI 同事真正能完成工作?

全面对比 Grok Bot 与 Claude Cowork 在计算机操控、持久记忆、多智能体团队、定价及权限管控方面的差异——以及两者都未提供的开源协作助手选项。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

立即体验 Eigent

下载开源桌面应用,在本地用 AI 工作团队开始自动化。

下载 Eigent
Eigent

获取关于 AI 员工自动化的最新更新和教程。

产品Eigent环境定价企业版
探索解决方案使用场景技能插件博客
开发者文档GitHubCAMEL-AI开源基金合作伙伴
下载开源版
公司关于我们品牌加入我们使用条款隐私政策安全与信任Cookie 政策退款与试用政策

保留所有权利 © 2026 EIGENT UK LTD

Eigent 1.0 新版本发布!download