Gemini 4 Argon:新功能、基準測試與定價
Google 最新的前沿模型專為長時程、多步驟工作而生,涵蓋程式開發、法律、金融與網路安全防禦——以下是真正改變了什麼。

Google 剛宣布推出 Gemini 4 Argon,這是其最新的前沿模型,專為在長時程、多步驟工作流程中維持深度推理能力而設計。主打賣點:在真實世界的軟體工程、法律與金融等企業知識工作,以及網路安全防禦上達到前沿水準——這類任務需要智能代理執行許多步驟,而非單一提示就能完成。本指南涵蓋新功能、Google 公布的基準測試、費用、躍升至 100 萬輸出 token 的上限,以及誰能優先取得存取權。
什麼是 Gemini 4 Argon?
Gemini 4 Argon 是 Google 最新的前沿模型,定位為其「前沿智能的新紀元」。Google 描述它專為在複雜、長時程工作流程中維持深度推理而生,在真實世界的軟體工程、法律與金融等企業知識工作,以及網路安全防禦上提供前沿水準的表現(Google)。
它於 2026 年 9 月 30 日正式發表。與一般的模型發布不同,Argon 並非在第一天就全面開放——Google 首先透過其 Fairwind 計畫向一批受信任的網路安全防禦者推出,隨後在強化防護機制後,再逐步擴展至開發者、企業與一般消費者(Google)。
Gemini 4 Argon 的新功能
對開發者而言,最重要的改變是在單次執行中能進行更長時間的思考。
- 100 萬輸出 token 上限。 Google 大幅擴展了模型的輸出 token 上限,達到業界領先的 100 萬 token,相較於先前的 64K 大幅提升。Google 表示,當模型有足夠空間在單次推理軌跡中生成數十萬個 token 時,便能在推理上達到全新的深度層次,並一次性解決棘手問題(Google)。
- 長時程任務導向。 Argon 針對需要規劃、工具呼叫,以及在多個步驟中保持專注的任務進行調校——從日常除錯到大規模程式碼庫遷移皆適用。
- 多模態知識工作。 Google 強調當任務需要視覺理解時的優異表現——包括專業圖表分析、從長影片中擷取細節,以及跨系列文件執行操作。
就背景而言,這是比 Google 近期推出的 Gemini 3.8 Flash 更重大的發布:Argon 是前沿等級的模型,針對最困難、最長時程的任務而設計,而非以低成本高吞吐量為目標。
Gemini 4 Argon 基準測試
以下所有數據均來自 Google 的發布資料,請將其視為廠商自行回報的基準測試,而非獨立驗證的結果(Google)。
- DeepSWE v1.1(長時程軟體工程): 77.9%,Google 稱此為真實世界長時程工程任務的全新最高水準。
- Vals Index: Argon 在此指數上位居領先,該指數衡量跨金融、程式開發、法律與稅務工作的經濟影響力,並依各領域對美國 GDP 的貢獻加權計算。
- AutomationBench(Zapier): 以 51.3% 的分數排名第一,衡量跨核心業務功能的端對端執行能力。
- LVBench(長影片理解): 91.7%,Google 引用此為目前最高水準。
- CWE-bench v1(漏洞修補): 以 68% 的最高分並列第一。
Google 也分享了內部測試結果:據稱 Argon 協助量子研究人員在數分鐘內將已發表的基準線提升了 40%,且 Argon 智能代理生成的 Rust 影片解碼器(針對 libgav1)在輸出完全相同的情況下,執行速度比現有 Rust 移植版本快 2.7 倍。這些應視為說明性的內部案例,而非可重現的基準測試。
Gemini 4 Argon 定價
Google 設定了優惠導入價格:
- 每百萬輸入 token 2 美元
- 每百萬輸出 token 10 美元
- 快取輸入 token 享有輸入 token 價格 95% 的折扣
優惠期結束後,標準價格將調漲至每百萬輸入 token 4 美元及每百萬輸出 token 20 美元(Google)。若您正在規劃 Argon 的使用,請注意 100 萬輸出上限加上前沿等級的輸出定價,意味著長時程、高 token 消耗的推理軌跡成本可能迅速攀升——請著重預算輸出費用,而非僅考量輸入。
在防禦性網路安全領域的領先地位
網路安全是本次發布的核心主題。Google 訓練 Argon 具備高度的防禦能力:它能自主發現、驗證並修補關鍵軟體漏洞。對於受信任的防禦者及 Google 內部團隊,Google 表示將在不設置網路安全防護限制的情況下發布 Argon,使其能充分發揮前沿等級的防禦能力(Google)。
Google 引用的一個早期案例:資安廠商 Wiz 透過其 Scan for Good 計畫使用 Argon,發現了一個關鍵漏洞,該漏洞暴露了全球醫院所使用的醫療軟體中的敏感個人資訊——Google 表示這是先前的前沿模型所遺漏的嚴重風險。
這延續了 Google 從 Gemini 3.8 Flash Cyber 變體開始的網路安全方向,將自主漏洞發現與修補能力擴展至前沿等級的模型。
安全性與分階段推出計畫
由於 Argon 具備前沿等級的能力——包括網路安全領域——Google 在廣泛發布前設置了存取門檻並強化防護措施。該公司表示正在:
- 參與美國政府針對發布前模型存取的自願性流程。
- 依據其前沿安全框架(Frontier Safety Framework)拒絕有害的網路安全及化學、生物、放射性、核武(CBRN)相關請求,同時保留合法的雙重用途研究空間。
- 強化對間接提示注入(indirect prompt injection)的防禦——即隱藏在上下文中的惡意指令試圖劫持模型——Google 宣稱在 Gray Swan 的間接提示注入基準測試上具有領先的穩健性。
- 監控 Argon 的思維鏈與行動,以偵測偏差並在必要時中止執行(Google)。
誰能取得 Gemini 4 Argon,以及何時開放
存取權採分階段開放:
- 現在: 透過 Fairwind 計畫的受信任網路安全防禦者,以及 Google 內部團隊。
- 下一階段: 開發者、企業與消費者,從付費 API 客戶及 Google AI Ultra 訂閱者開始。
簡言之,Argon 尚未全面開放。若您正在開發智能代理,實際的建議是現在先做好規劃,而非立即進行原型開發——並密切關注付費 API 的開放時程。
如果您在開發智能代理,這值得關注嗎?
Argon 的設計——長推理軌跡、大量工具呼叫,以及 100 萬輸出上限——直接對應到智能代理的工作負載:程式碼庫遷移、多步驟金融或法律研究,以及跨多個檔案的安全修補。目前待解的問題是前沿輸出定價下的成本,以及何時能在 Fairwind 計畫之外實際呼叫它。在此之前,較新的 Gemini 3.8 Flash 仍是高吞吐量智能代理迴圈的可用選項。
用您自己的 AI 工作團隊來實現這一切
像 Gemini 4 Argon 這樣的前沿模型,只有在有系統將其協調成真實、多步驟工作時才能發揮價值——包括規劃、呼叫工具,以及端對端完成任務。Eigent 是一款開源的「Cowork」桌面應用程式:一個在本機運行的多智能代理工作團隊,讓您能將強大的模型指向程式開發、研究與文件工作流程,同時將資料保留在您自己的機器上。了解智能代理工作團隊如何處理 GitHub PR 審查,或閱讀我們對 Gemini 3.8 Flash 在程式開發與智能代理應用上的分析。下載 Eigent,打造您自己的 AI 工作團隊。
Recent Posts

Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews
Eigent v1.0.5 improves Session recovery, task queues, process and file previews, Space settings, and model support.

Claude Opus 5.5:新功能、基準測試與定價
Claude Opus 5.5 完整解析:首款 Claude 5.5 模型,比 Opus 5 便宜 40%、輸出速度提升 30%、全新代理編程基準測試、定價方案與安全評分。

GPT-6 Sol 與 Luna:OpenAI 更具成本效益的程式開發與智能代理模型
GPT-6 Sol 與 Luna 是 OpenAI GPT-6 系列中定位低於 Astra 的新成員,大幅降低價格並強化程式開發能力。本文說明更新內容、基準測試結果,以及各模型的適用情境。