logo
  • 環境
  • 企業方案
  • 價格
Blogs
Jul 31, 2026

DeepSeek V4 Flash 正式發布:智能體基準測試超越 V4 Pro Preview

相同架構、相同定價、重新訓練的權重——這款低成本模型在智能體任務上已超越預覽版旗艦,並原生支援 Responses API 及 Codex

EigentEigent
Share to
DeepSeek V4 Flash 正式發布:智能體基準測試超越 V4 Pro Preview
  • 究竟改變了什麼
  • 基準測試數據
  • 為何「相同規模、更強智能體」如此重要
  • Responses API 與 Codex 支援
  • 這對你的技術棧意味著什麼
  • 用你自己的 AI 工作團隊來實現這一切
  • 常見問題
Automate Everything with
AI Workforce on Desktop
Download Eigent

DeepSeek 剛剛將其 V4 Flash API 的正式版本推送至公開測試階段——這次的重點不是全新模型,而是一次重新訓練。此版本標記為 DeepSeek-V4-Flash-0731,保留了與預覽版完全相同的架構、規模和定價,但其智能體基準測試分數現已遠超 V4-Pro-Preview——即同系列中規模更大、定價更高的模型。此外,它還新增了原生 Responses API 支援,並針對 Codex 進行了適配。如果你已在呼叫 deepseek-v4-flash,你 API 背後的模型剛剛免費獲得了大幅提升。

究竟改變了什麼

根據 DeepSeek 官方 API 更新日誌,V4 Flash 官方 API 現已進入公開測試階段,呼叫方式保持不變——你只需將模型名稱設定為 deepseek-v4-flash,與預覽期間完全一致。(DeepSeek 更新日誌)

此次發布由三個核心事實定義:

  • 這是重新訓練,而非全新模型。 DeepSeek 表示,V4-Flash-0731 保留了與 V4-Flash-Preview 相同的架構和規模,僅進行了後訓練(post-training)的重新訓練。相同骨架上的新權重——這也是為何整合只需直接替換。(DeepSeek 更新日誌)
  • 智能體數據才是重點。 DeepSeek 描述了「顯著增強的智能體能力」,基準測試結果遠超 V4-Pro-Preview。此次升級針對複雜任務中的自主執行與工具呼叫能力。(DeepSeek 更新日誌)
  • 目前僅限 API。 此次升級僅適用於 V4 Flash API。V4 Pro API 以及 DeepSeek 應用程式和網站上的模型均未變更,DeepSeek 表示 V4 Pro 正式版將很快跟進。(DeepSeek 更新日誌)

最值得關注的是其戰略意義。在 V4 系列的大部分時間裡,層級關係十分清晰:Pro 性能強勁,Flash 廉價但能力較弱。這次重新訓練顛覆了智能體工作負載的這一格局——輕量級模型現在在測試中的表現已超越預覽版旗艦。(TechNode)

基準測試數據

DeepSeek 隨 0731 版本發布了完整的基準測試表格。以下是更新日誌中官方自報的分數:

基準測試V4-Flash-0731
Terminal Bench 2.182.7
NL2Repo54.2
Cybergym76.7
DeepSWE54.4
Toolathlon(已驗證)70.3
Agent Last Exam25.2
Automation Bench(公開版)25.1
DSBench-FullStack68.7
DSBench-Hard59.6

來源:DeepSeek API 更新日誌。DSBench-FullStack 和 DSBench-Hard 是 DeepSeek 的內部測試集——分別為全棧開發套件和高難度編程智能體套件。

在過度解讀「超越 V4 Pro Preview」這一說法之前,有兩點需要注意:

  • 這並非完全公平的對比。 V4-Flash-0731 在 Terminal Bench 2.1 上得分 82.7,而報道中引用的 V4-Pro-Preview 數據(67.9)來自 Terminal Bench 2.0——不同版本的測試集,因此直接比較並不完全公平。(36Kr)
  • 代碼智能體任務使用了特定的測試框架。 DeepSeek 指出,公開的代碼智能體基準測試使用其「DeepSeek Harness 最小模式」(尚未發布)在最大努力、top-p 0.95、temperature 1.0 的條件下運行。你的生產環境數據取決於你自己的腳手架配置。(DeepSeek 更新日誌)

儘管如此,其量級仍然值得關注:一個約有 130 億激活參數的模型能在智能體測試中達到這樣的分數,充分說明了後訓練本身能帶來多大的提升空間。(36Kr)

為何「相同規模、更強智能體」如此重要

V4 Flash 是一個擁有 2840 億參數的 MoE(混合專家)模型,約有 130 億激活參數,而 V4 Pro 的總參數量為 1.6 兆,約有 490 億激活參數。兩者均共享 100 萬 token 的上下文窗口。Flash 的核心優勢在於吞吐量和成本——你以部分能力換取速度。(完整規格對比,請參閱我們的 DeepSeek V4 Pro 指南。)

在不改變參數量的情況下提升智能體性能,DeepSeek 正在針對大多數團隊在生產環境中遇到的痛點:他們需要低成本、高並發的自動化,但又無法在每個智能體步驟上都運行 1.6 兆參數的旗艦模型。一個能夠良好處理工具呼叫和多步驟執行的低成本模型,從根本上改變了大規模運行智能體的經濟效益。(BigGo Finance)

對於構建智能體管道的開發者而言,實際的啟示在於路由策略:更多日常智能體步驟現在可以默認使用 Flash,僅在真正困難的分支時才升級至更重量級的模型。

Responses API 與 Codex 支援

此次發布的另一半降低了整合門檻。官方 V4 Flash 原生支援 Responses API 格式,並專門針對 Codex 進行了適配。(DeepSeek 更新日誌)

這一點至關重要,因為 Responses API 是 OpenAI 較新的智能體工具(包括 Codex)所期望的格式。原生支援意味著已接入 Codex 風格工作流程的團隊,只需通過配置更改而非重寫代碼,即可將其指向 deepseek-v4-flash。DeepSeek 表示,其目標是降低開發者採用的門檻,配置詳情可在其 API 文檔中找到。(BigGo Finance)

結合 V4 API 已可通過 OpenAI 風格的 ChatCompletions 和 Anthropic 風格的接口訪問這一事實,DeepSeek 顯然正在針對主要智能體生態系統優化其即插即用的兼容性。(DeepSeek 更新日誌)

這對你的技術棧意味著什麼

如果你基於 DeepSeek 進行開發,以下是簡要總結:

  • 已在使用預覽版? 無需任何代碼更改即可獲得升級——相同的模型名稱、相同的定價、更好的智能體表現。重新運行你的評估,確認改進在你的任務上(而非僅在已發布的基準測試中)有所體現。
  • 正在運行 Codex 風格的工作流程? 得益於原生 Responses API 支援和 Codex 適配,V4 Flash 現在是作為低成本後端的真正候選方案。
  • 等待 V4 Pro? DeepSeek 表示官方 Pro 版本即將推出;這次 Flash 的重新訓練是你可能在 Pro 上看到的後訓練提升的預覽。
  • 將供應商基準測試視為方向性參考。 這些分數是自報的,部分測試集為內部數據,且 Terminal Bench 版本不匹配意味著「超越 Pro Preview」的說法需要加上星號,直到獨立評估結果出爐。

用你自己的 AI 工作團隊來實現這一切

模型變得更便宜同時更強大,正是模型無關的智能體平台物有所值的原因——你希望為每個步驟接入最佳模型,而無需重新設計架構。Eigent 是一款開源的多智能體「協作」桌面應用,能夠跨真實工作流程協調專業模型,讓你可以將常規智能體步驟路由至 V4 Flash 這樣快速、低成本的模型,並在困難分支時升級至其他模型。如果你正在構建智能體編程任務,可以了解 Eigent 如何處理審查 GitHub PR 等工作流程,或下載 Eigent 在本地構建你自己的 AI 工作團隊。

常見問題

DeepSeek V4 Flash 是什麼?

DeepSeek V4 Flash 是 DeepSeek V4 模型系列的輕量級變體——一個擁有 2840 億參數的混合專家(Mixture-of-Experts)模型,約有 130 億激活參數,上下文窗口為 100 萬 token,專為快速、低成本、高吞吐量的工作負載而優化。官方 API(0731 版本)現已進入公開測試階段。

V4 Flash 正式版有何變化?

0731 版本保留了與預覽版相同的架構、規模和定價,但經過了重新後訓練,帶來了顯著更強的智能體基準測試分數。它還新增了原生 Responses API 支援和 Codex 適配。呼叫方式保持不變——你仍然將模型名稱設定為 deepseek-v4-flash。

V4 Flash 的基準測試真的超越了 V4 Pro Preview 嗎?

DeepSeek 自報的智能體分數在多個基準測試上超越了 V4-Pro-Preview。但這一比較並非完全公平——例如,Flash 的分數來自 Terminal Bench 2.1,而引用的 Pro Preview 分數來自 Terminal Bench 2.0。在獨立評估確認之前,請將這些數字視為方向性參考。

V4 Flash 是否支援 Codex?

是的。官方 V4 Flash 原生支援 Responses API 格式,並專門針對 Codex 進行了適配,因此 Codex 風格的工作流程只需通過配置更改(而非重寫代碼)即可將其用作後端。

V4 Pro 是否會獲得相同的升級?

暫時不會。此次更新僅適用於 V4 Flash API。V4 Pro API 以及 DeepSeek 應用程式和網頁版模型均未變更,不過 DeepSeek 表示官方 V4 Pro 版本將很快推出。

Recent Posts

Grok Bot:SpaceXAI 的 AI 隊友,真正完成實際工作
Aug 11, 2026

Grok Bot:SpaceXAI 的 AI 隊友,真正完成實際工作

Grok Bot 是 SpaceXAI 與 Cursor 的全新 AI 代理——能登入您的工具並完成真實工作的隊友。了解其功能、適用對象及比較分析。

EigentEigent
Grok Bot vs. ChatGPT Work:哪個智能 AI 工作團隊更勝一籌?
行業Aug 11, 2026

Grok Bot vs. ChatGPT Work:哪個智能 AI 工作團隊更勝一籌?

Grok Bot vs ChatGPT Work 全面比較:電腦操控代理 vs 執行模式、自主能力、連接器、定價,以及哪款智能 AI 工作團隊更適合你的團隊。

EigentEigent
Grok Bot vs Claude Cowork:哪個 AI 同事真正完成工作?
行業Aug 11, 2026

Grok Bot vs Claude Cowork:哪個 AI 同事真正完成工作?

全面比較 Grok Bot 與 Claude Cowork 的電腦操作能力、持久記憶、多代理團隊、定價及控制機制——並介紹兩者均未提供的開源協作夥伴選項。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

立即試用 Eigent

下載開源桌面 app。你的 AI workforce,直接在你電腦上運行。

下載 Eigent
Eigent

獲取 AI workforce 自動化的最新更新、教學與版本消息。

產品Eigent環境定價企業方案
探索解決方案使用案例技能外掛網誌
開發者文件GitHubCAMEL-AIOpen Source Fund合作夥伴
下載適用於開源版
公司關於我們品牌招聘使用條款私隱政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD

Eigent 1.0 新版本已發佈!download