Gemini 3.8 Flash:編程與 AI 代理的全新升級
Google 最快速的主力模型在編程、代理推理及網絡安全方面獲得重大升級——以下是實際的改變。

Google 剛剛推出了 Gemini 3.8 Flash,這是其在約六週內發布的第三個 Flash 版本,也是迄今為止「最智能的主力模型」。核心賣點十分簡單:在軟件工程、代理任務及多步驟推理方面取得顯著進步——同時保持與 3.7 Flash 相同的速度和低廉價格。另有一個獨立的 Gemini 3.8 Flash Cyber 變體,專門針對漏洞發現與修補。本指南涵蓋具體改變、Google 發布的基準測試數據、定價,以及對 AI 代理開發者的適用場景。
什麼是 Gemini 3.8 Flash?
Gemini 3.8 Flash 是 Google Flash 系列中的一款輕量級多模態(multimodal)模型,專為長時程(long-horizon)編程和自主代理而優化。Google 將其定位為「我們最智能的主力模型」,在工程、代理工作及專業領域推理方面均優於 3.7 Flash(Google)。
該模型於 2026 年 9 月 2 日發布,距 3.7 Flash 僅三週——這是 Google 自 7 月底 Gemini 3.6 Flash 以來,大約每三週發布一個新 Flash 模型的節奏(Thurrott)。
此次發布包含兩個基於相同基礎智能構建的變體:
- Gemini 3.8 Flash — 用於編程、代理及企業工作流程的通用主力模型。
- Gemini 3.8 Flash Cyber — 專注於網絡安全的模型,用於漏洞檢測和自動修補,僅通過全新的 Fairwind Program 向受信任的防禦者開放。
相較 Gemini 3.7 Flash 的新變化
最大亮點是 3.8 Flash 在「不提高價格」的前提下,「相較 3.7 Flash 取得了實質性進步」,並「在性能上往往接近更高成本的前沿模型」(9to5Google)。
Google 將這一飛躍歸因於一個設計選擇:模型更加努力地工作。在處理複雜任務時,它會執行更多推理步驟並迭代地調用工具,這意味著在較高努力級別下可能產生更多的 token 使用量。如果計算成本是您的主要限制,Google 表示您可以降低努力級別,或繼續使用 3.7 Flash——後者仍然支持效率優先的工作負載。
這種取捨對代理開發者至關重要。更強的執行力和迭代工具調用正是長時程代理循環所需要的——但這也意味著您應該留意高量低複雜度任務的 token 開銷。
Gemini 3.8 Flash 基準測試
Google 發布了涵蓋編程、金融、法律及通用推理的測試結果。以下所有數據均來自 Google 的發布材料,請將其視為廠商基準測試而非獨立測試。
- DeepSWE v1.1(長時程軟件工程): 3.8 Flash 在以極低成本自主解決複雜工程問題方面,優於大多數更大型的前沿模型(Google)。
- Vals Finance Agent V2 及 Harvey's Legal Agent Benchmark: 3.8 Flash 在這些專業領域中超越了 3.7 Flash 及其他前沿模型。
- HLE-Verified(人類最後考試): 54.9%,Google 引用此數據作為跨 STEM、人文及專業領域多步驟推理能力的佐證(9to5Google)。
貫穿其中的主線是代理能力——在需要規劃、使用工具並在多個步驟中保持專注的領域,而不僅僅是回答單一提示。
值得注意的一點:與上一個模型一樣,Gemini 3.8 Flash 在某些領域的知識截止日期為 2026 年 3 月,而在其他領域可能僅限於 2025 年 1 月(9to5Google)。對於任何近期資訊,請計劃為其提供最新上下文或工具。
Gemini 3.8 Flash 定價
Google 將入門價格與 3.7 Flash 保持一致:
- 每百萬輸入 token $0.75
- 每百萬輸出 token $3.75
此入門價格有效期至 2026 年 12 月 31 日;之後標準價格將上調至每百萬輸入 token $1.50,每百萬輸出 token $7.50(Google)。如果您正在基於此模型構建應用,請將 1 月份的價格變動納入長期成本模型——並記住「更努力工作」的行為可能會在複雜任務中推高輸出 token 數量。
Gemini 3.8 Flash 的使用場景
Google 在發布首日即在消費者、開發者及企業端全面上線:
- 消費者: Gemini 應用程式、Google 搜索中的 AI Mode,以及 Google Sheets 中的 Gemini,適用於 Google AI Pro 和 Ultra 訂閱用戶(Search Engine Journal)。
- 開發者: Google Antigravity、AI Studio、Android Studio 及 Gemini API。
- 企業: Gemini Enterprise。
對於代理開發者而言,API 訪問是最重要的——它讓您可以將 3.8 Flash 整合到自己的編排系統中,而非局限於 Google 的應用程式。
Gemini 3.8 Flash Cyber:安全專用變體
Cyber 變體是此次發布中最具創新性的部分。它面向防禦者,優先考慮漏洞修復而非進攻性能力。Google 報告其在 CyberGym(自主漏洞發現的標準基準測試)上達到前沿水平,並在涵蓋 20 種編程語言的內部基準測試中成功率超過 70%(Google)。
Google 引用其自身安全團隊的實際成果:
- Chrome 安全團隊發現,3.8 Flash Cyber 對 Chrome 漏洞產生的正確修補數量是大型商業模型的 2.6 倍(9to5Google)。
- 安全廠商 Wiz 測量到,在內部滲透測試基準上,其召回率高出 7.5–9.7%,成本卻低 2.3–5.2 倍,優於其他領先前沿模型。
- Google 的雲端漏洞研究團隊利用它在兩小時內發現了一個關鍵基礎漏洞——這項工作通常需要數月時間。
需要注意的是:3.8 Flash Cyber 僅通過 Fairwind Program 向受信任的政府機構、關鍵基礎設施運營商及軟件維護者開放,並非公開 API 發布。
是否應該從 3.7 Flash 升級?
根據 Google 發布的信息,以下是快速決策指南:
- 正在構建編程或多步驟代理? 3.8 Flash 是值得升級的選擇——更強的長時程工程能力和工具使用正是其核心優勢。
- 運行高量、簡單且以成本為主要考量的任務? 繼續使用 3.7 Flash 或降低努力級別;「更努力工作」的行為可能增加 token 費用。
- 從事防禦性安全工作且符合 Fairwind 資格? 申請 3.8 Flash Cyber。
- 需要最新知識? 接入檢索工具或實時工具——由於知識截止日期的限制,模型無法自行了解近期事件。
用您自己的 AI 工作團隊實踐
Gemini 3.8 Flash 正是為 Eigent 所採用的模式而生:長時程、工具調用的代理,能夠規劃並執行真實工作,而非僅僅回答單一提示。Eigent 是一款開源「協作(Cowork)」桌面應用程式——一個在本地自動化工作流程的多代理工作團隊,讓您可以將強大的模型用於編程、研究和文檔任務,同時將數據保留在您的設備上。如果您看好 3.8 Flash 的代理能力提升,不妨了解如何通過代理工作團隊審查 GitHub PR,或參考我們對最佳開源 AI 編程代理的深度解析。下載 Eigent,立即構建您自己的 AI 工作團隊。
Recent Posts

Claude Fable 5.1 與 Mythos 5.1:全新功能詳解
Claude Fable 5.1 與 Mythos 5.1 詳解:同一模型分兩個安全防護層級,附全新基準測試結果、成本降低約 25 至 45%,以及存取詳情。

GPT-6 Astra:OpenAI 全新模型的真實能力
GPT-6 Astra 是 OpenAI 的全新旗艦模型。本文詳解其功能、基準測試表現、定價方案,以及 AGI 標題背後的注意事項。

Muse Spark 1.3:Meta 前沿編程與智能代理模型詳解
Muse Spark 1.3 是 Meta 最新的前沿編程與智能代理模型。查看基準測試、定價、xhigh 與 max 版本對比、功能變化及與競品的比較。