DeepSeek V4 Flash 正式發布:智能體基準測試超越 V4 Pro Preview
相同架構、相同定價、重新訓練的權重——這款低成本模型在智能體任務上已超越旗艦預覽版,並原生支援 Responses API 與 Codex

DeepSeek 剛將其 V4 Flash API 的正式版本推入公開測試階段——這次的重點不是全新模型,而是重新訓練。這個版本標記為 DeepSeek-V4-Flash-0731,保留了與預覽版完全相同的架構、規模和定價,但其智能體基準測試分數現已遠超 V4-Pro-Preview——後者是同系列中規模更大、定價更高的模型。此版本還新增了原生 Responses API 支援,並針對 Codex 進行了適配。如果你已在呼叫 deepseek-v4-flash,你的 API 背後的模型剛剛免費獲得了大幅升級。
實際變更了什麼
根據 DeepSeek 官方 API 更新日誌,V4 Flash 官方 API 現已進入公開測試階段,呼叫方式維持不變——你只需將模型名稱設定為 deepseek-v4-flash,與預覽期間完全相同。(DeepSeek 更新日誌)
這次發布有三個核心事實:
- 這是重新訓練,而非全新模型。 DeepSeek 表示,V4-Flash-0731 保留了與 V4-Flash-Preview 相同的架構和規模,僅進行了後訓練(post-training)的重新訓練。相同骨架上的新權重——這也是為何整合只需直接替換即可。(DeepSeek 更新日誌)
- 智能體數據才是重點。 DeepSeek 描述了「顯著增強的智能體能力」,基準測試結果遠超 V4-Pro-Preview。此次升級針對複雜任務中的自主執行與工具呼叫能力。(DeepSeek 更新日誌)
- 目前僅限 API。 此次升級僅適用於 V4 Flash API。V4 Pro API 以及 DeepSeek 應用程式和網站上的模型均未變更,DeepSeek 表示 V4 Pro 正式版將很快跟進。(DeepSeek 更新日誌)
最值得關注的是其戰略意涵。在 V4 世代的大部分時間裡,層級關係很簡單:Pro 能力強,Flash 便宜但較弱。這次重新訓練在智能體工作負載上顛覆了這個格局——輕量模型現在的數據已超越預覽旗艦版。(TechNode)
基準測試數據
DeepSeek 發布了 0731 版本的完整基準測試表格。以下是更新日誌中官方自行回報的分數:
| 基準測試 | V4-Flash-0731 |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| Cybergym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon(已驗證) | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench(公開版) | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
資料來源:DeepSeek API 更新日誌。DSBench-FullStack 和 DSBench-Hard 是 DeepSeek 的內部測試集——分別為全端開發套件和高難度程式碼智能體套件。
在過度解讀「超越 V4 Pro Preview」這個說法之前,有兩點需要注意:
- 比較並非完全同等條件。 V4-Flash-0731 在 Terminal Bench 2.1 上得分 82.7,而報導中引用的 V4-Pro-Preview 數據(67.9)是在 Terminal Bench 2.0 上——不同版本的測試集,因此直接比較並不完全公平。(36Kr)
- 程式碼智能體任務使用了特定測試框架。 DeepSeek 指出,公開的程式碼智能體基準測試是使用其「DeepSeek Harness 最小模式」(尚未發布)以最大努力、top-p 0.95、temperature 1.0 執行的。你的生產環境數據取決於你自己的腳手架設定。(DeepSeek 更新日誌)
儘管如此,其幅度仍值得關注:一個約有 130 億激活參數的模型能在這個範圍內取得智能體分數,充分展示了後訓練本身能帶來多大的提升空間。(36Kr)
為何「相同規模、更強智能體」如此重要
V4 Flash 是一個 2840 億參數的 MoE(混合專家)模型,約有 130 億激活參數,而 V4 Pro 的總參數為 1.6 兆,約有 490 億激活參數。兩者共享 100 萬 token 的上下文視窗。Flash 的核心優勢在於吞吐量和成本——你以部分能力換取速度。(完整規格比較,請參閱我們的 DeepSeek V4 Pro 指南。)
在不改變參數數量的情況下提升智能體性能,DeepSeek 正在針對大多數團隊在生產環境中遇到的痛點:他們需要低成本、高並發的自動化,但無法在每個智能體步驟上都運行 1.6 兆參數的旗艦模型。一個能夠良好處理工具呼叫和多步驟執行的低成本模型,從根本上改變了大規模運行智能體的經濟效益。(BigGo Finance)
對於構建智能體管道的開發者而言,實際的啟示在於路由策略:更多日常智能體步驟現在可以預設使用 Flash,僅在真正困難的分支時才升級到更重量級的模型。
Responses API 與 Codex 支援
此次發布的另一半降低了整合門檻。官方 V4 Flash 原生支援 Responses API 格式,並專門針對 Codex 進行了適配。(DeepSeek 更新日誌)
這一點很重要,因為 Responses API 是 OpenAI 較新的智能體工具——包括 Codex——所期望的格式。原生支援意味著已接入 Codex 風格工作流程的團隊,只需修改配置即可將其指向 deepseek-v4-flash,而無需重寫程式碼。DeepSeek 表示目標是降低開發者採用的門檻,配置詳情可在其 API 文件中找到。(BigGo Finance)
加上 V4 API 已可透過 OpenAI 風格的 ChatCompletions 和 Anthropic 風格的介面存取,DeepSeek 顯然正在針對主要智能體生態系統的即插即用相容性進行優化。(DeepSeek 更新日誌)
這對你的技術棧意味著什麼
如果你在 DeepSeek 上進行開發,以下是重點摘要:
- 已在使用預覽版? 無需修改程式碼即可獲得升級——相同的模型名稱、相同的定價、更好的智能體表現。重新執行你的評估測試,確認改進在你的任務上也能體現,而不僅僅是已發布的基準測試。
- 正在運行 Codex 風格的工作流程? 得益於原生 Responses API 支援和 Codex 適配,V4 Flash 現在是作為低成本後端的有力候選。
- 等待 V4 Pro? DeepSeek 表示官方 Pro 版本即將推出;這次 Flash 的重新訓練是你可能在那裡看到的後訓練提升的預覽。
- 將廠商基準測試視為方向性參考。 這些分數是自行回報的,部分測試集是內部的,而 Terminal Bench 版本不一致意味著「超越 Pro Preview」的說法需要加上星號,直到獨立評估結果出爐。
用你自己的 AI 工作團隊來實現這一切
模型變得更便宜同時更強大,正是模型無關的智能體平台能發揮價值的原因——你希望為每個步驟插入最佳模型,而無需重新設計架構。Eigent 是一款開源的多智能體「協作」桌面應用程式,能夠跨真實工作流程協調專業模型,讓你可以將常規智能體步驟路由到像 V4 Flash 這樣快速、低成本的模型,並在困難分支時升級到其他模型。如果你正在構建智能體程式碼任務,可以了解 Eigent 如何處理審查 GitHub PR 等工作流程,或下載 Eigent 在本地構建你自己的 AI 工作團隊。
常見問題
DeepSeek V4 Flash 是什麼?
DeepSeek V4 Flash 是 DeepSeek V4 模型系列的輕量版本——一個擁有 2840 億參數的混合專家(Mixture-of-Experts)模型,約有 130 億激活參數和 100 萬 token 的上下文視窗,針對快速、低成本、高吞吐量的工作負載進行了調優。官方 API(0731 版本)現已進入公開測試階段。
V4 Flash 正式版有什麼變化?
0731 版本保留了與預覽版相同的架構、規模和定價,但經過了重新後訓練,帶來了顯著更強的智能體基準測試分數。它還新增了原生 Responses API 支援和 Codex 適配。呼叫方式不變——你仍然將模型名稱設定為 deepseek-v4-flash。
V4 Flash 的基準測試真的超越了 V4 Pro Preview 嗎?
DeepSeek 自行回報的智能體分數在多個基準測試上超越了 V4-Pro-Preview。但比較並非完全同等條件——例如,Flash 的分數是在 Terminal Bench 2.1 上,而引用的 Pro Preview 分數是在 Terminal Bench 2.0 上。在獨立評估確認之前,請將這些數據視為方向性參考。
V4 Flash 可以與 Codex 搭配使用嗎?
可以。官方 V4 Flash 原生支援 Responses API 格式,並專門針對 Codex 進行了適配,因此 Codex 風格的工作流程只需修改配置即可將其作為後端使用,無需重寫程式碼。
V4 Pro 會獲得相同的升級嗎?
目前還不會。此次更新僅適用於 V4 Flash API。V4 Pro API 以及 DeepSeek 的應用程式和網頁模型均未變更,不過 DeepSeek 表示官方 V4 Pro 版本將很快推出。
Recent Posts

Grok 4.6 功能與 AI 代理的實際應用場景
深入了解 Grok 4.6 的功能與應用場景:長時間運行的代理、程式開發與視覺化工作,以及如何在多代理 AI 工作團隊中使用它。

Grok 4.6 vs Grok 4.5、GPT-5.6 Sol 與 Fable 5:實際有哪些改變
Grok 4.6 vs Grok 4.5、GPT-5.6 Sol 與 Fable 5:xAI 實際確認的內容、仍屬推測的部分,以及這次純後訓練升級必須跨越的真實基準門檻。

Grok Bot:SpaceXAI 的 AI 隊友,真正完成實際工作
Grok Bot 是 SpaceXAI 與 Cursor 推出的全新 AI Agent——能登入您的工具並完成真實工作的隊友。了解它的功能、適用對象,以及與其他產品的比較。