logo
  • 环境
  • 企业版
  • 价格
Blogs
Oct 2, 2026

Gemini 4 Argon:新特性、基准测试与定价

Google 全新前沿模型专为编程、法律、金融和网络安全防御等长流程、多步骤任务而生——以下是真正的变化。

EigentEigent
Share to
Gemini 4 Argon:新特性、基准测试与定价
  • 什么是 Gemini 4 Argon?
  • Gemini 4 Argon 的新特性
  • Gemini 4 Argon 基准测试
  • Gemini 4 Argon 定价
  • 引领防御性网络安全
  • 安全机制与分阶段发布
  • 谁能获得 Gemini 4 Argon,以及何时获得
  • 构建智能体的开发者需要关注吗?
  • 用您自己的 AI 工作团队来实现这一切
Automate Everything with
AI Workforce on Desktop
Download Eigent

Google 刚刚发布了 Gemini 4 Argon,这是其全新前沿模型,专为在长流程、多步骤工作流中持续进行深度推理而构建。核心定位:在真实软件工程场景、法律与金融等企业知识工作,以及网络安全防御领域实现前沿性能——这类任务需要智能体完成许多步骤,而非一次提示即可完成。本文涵盖新特性、Google 发布的基准测试数据、定价方案、100万输出 token 上限的重大突破,以及优先访问权限的分配方式。

什么是 Gemini 4 Argon?

Gemini 4 Argon 是 Google 最新的前沿模型,定位为其"前沿智能的新纪元"。Google 将其描述为专为在复杂、长周期工作流中持续进行深度推理而构建,在真实软件工程、法律与金融等企业知识工作,以及网络安全防御领域均能实现前沿性能(Google)。

该模型于 2026 年 9 月 30 日正式发布。与常规模型发布不同,Argon 并非首日全面开放——Google 将首先通过其 Fairwind 计划向一批受信任的网络安全防御者推出,随后在完善安全护栏后逐步向开发者、企业和消费者扩展(Google)。

Gemini 4 Argon 的新特性

对于开发者而言,最重要的变化是单次推理的更长思考能力。

  • 100万输出 token 上限。 Google 大幅提升了模型的输出 token 上限,达到业界领先的 100 万 token,较此前的 64K 大幅提升。其核心主张是:当模型在单次推理轨迹中有空间生成数十万 token 时,可以在推理深度上实现质的飞跃,一次性解决复杂难题(Google)。
  • 长周期任务专项优化。 Argon 针对需要规划、工具调用并在多步骤中保持专注的任务进行了调优——从日常调试到大规模代码库迁移均有覆盖。
  • 多模态知识工作。 Google 重点强调了其在需要视觉理解的任务中的优势——专业图表分析、从长视频中提取关键信息,以及跨系列文档的操作执行。

从背景来看,这是一次比 Google 近期发布的 Gemini 3.8 Flash 更重大的版本更新:Argon 是面向最复杂、最长周期任务的前沿级模型,而非面向高性价比大批量工作的效率型模型。

Gemini 4 Argon 基准测试

以下所有数据均来自 Google 的发布材料,请将其视为厂商自报基准测试,而非独立第三方测试结果(Google)。

  • DeepSWE v1.1(长周期软件工程): 77.9%,Google 称其为真实世界长周期工程任务的全新最优水平。
  • Vals Index: Argon 在该指数上位居榜首,该指数衡量金融、编程、法律和税务工作的经济影响,并按各行业对美国 GDP 的贡献加权计算。
  • AutomationBench(Zapier): 以 51.3% 的得分排名第一,衡量跨核心业务功能的端到端执行能力。
  • LVBench(长视频理解): 91.7%,Google 称其为当前最优水平。
  • CWE-bench v1(漏洞修复): 以 68% 的最高分并列第一。

Google 还分享了内部测试结果:据称 Argon 帮助量子研究人员在数分钟内将已发表的基准线提升了 40%;Argon 智能体生成的 Rust 视频解码器(用于 libgav1)在输出完全相同的情况下,运行速度比现有 Rust 移植版本快 2.7 倍。请将这些视为说明性内部案例,而非可复现的基准测试。

Gemini 4 Argon 定价

Google 设定了入门价格:

  • 每百万输入 token 2 美元
  • 每百万输出 token 10 美元
  • 缓存输入 token 在输入 token 价格基础上享受 95% 折扣

入门期结束后,标准价格将上调至每百万输入 token 4 美元、每百万输出 token 20 美元(Google)。如果您正在围绕 Argon 进行规划,请注意 100 万输出上限叠加前沿级输出定价,意味着长流程、高 token 消耗的推理轨迹成本会迅速攀升——预算规划时需重点考虑输出成本,而非仅关注输入成本。

引领防御性网络安全

网络安全是本次发布的核心亮点。Google 对 Argon 进行了专项训练,使其在防御领域具备强大能力:可自主发现、验证并修复关键软件漏洞。对于受信任的防御者和 Google 内部团队,Google 表示将在不附加网络安全护栏的情况下发布 Argon,以便他们充分利用其前沿级防御能力(Google)。

Google 引用的一个早期案例:安全厂商 Wiz 通过其 Scan for Good 计划使用 Argon,发现了一个关键漏洞,该漏洞导致全球多家医院使用的医疗软件中的敏感个人信息遭到暴露——Google 表示此前的前沿模型均未能发现这一严重风险。

这是在 Google 通过 Gemini 3.8 Flash Cyber 变体开启的网络安全方向基础上的延伸,将自主漏洞发现与修复能力提升至前沿级模型层面。

安全机制与分阶段发布

由于 Argon 具备前沿级能力(包括网络安全领域),Google 在广泛发布前对其进行了访问限制并强化了安全保障措施。Google 表示正在:

  • 参与美国政府针对发布前模型访问的自愿性流程。
  • 依据其前沿安全框架(Frontier Safety Framework)拒绝有害的网络安全和 CBRN(化学、生物、放射性、核)请求,同时保留合法的双重用途研究空间。
  • 强化对间接提示注入(indirect prompt injection)的防御——即隐藏在上下文中的恶意指令试图劫持模型——Google 声称在 Gray Swan 的间接提示注入基准测试上具有领先的鲁棒性。
  • 监控 Argon 的思维链和执行动作,以发现对齐偏差并在必要时中止执行(Google)。

谁能获得 Gemini 4 Argon,以及何时获得

访问权限分阶段开放:

  • 当前: 通过 Fairwind 计划向受信任的网络安全防御者开放,以及 Google 内部团队。
  • 下一阶段: 向开发者、企业和消费者开放,首先面向付费 API 客户和 Google AI Ultra 订阅用户。

简而言之,Argon 目前尚未全面开放。如果您正在构建智能体,实际建议是提前规划而非今天就开始原型开发——并持续关注付费 API 的开放时间。

构建智能体的开发者需要关注吗?

Argon 的设计理念——长推理轨迹、大量工具调用和 100 万输出上限——与智能体工作负载高度契合:代码库迁移、多步骤金融或法律研究,以及跨多个文件的安全修复。目前的开放性问题在于前沿级输出定价下的成本,以及何时能在 Fairwind 之外正式调用。在此之前,较新的 Gemini 3.8 Flash 仍是高频智能体循环的可用选项。

用您自己的 AI 工作团队来实现这一切

像 Gemini 4 Argon 这样的前沿模型,只有在有系统将其编排成真实的多步骤工作时才能发挥价值——包括规划、调用工具,以及端到端完成任务。Eigent 是一款开源"协作(Cowork)"桌面应用:一支在本地运行的多智能体工作团队,让您可以将强大的模型指向编程、研究和文档工作流,同时将数据保留在本地设备上。了解智能体工作团队如何处理 GitHub PR 审查,或阅读我们对 Gemini 3.8 Flash 在编程和智能体场景中的应用的深度解析。下载 Eigent,打造属于您自己的 AI 工作团队。

Recent Posts

Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews
产品Sep 25, 2026

Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews

Eigent v1.0.5 improves Session recovery, task queues, process and file previews, Space settings, and model support.

Douglas LaiDouglas Lai
Claude Opus 5.5:新特性、基准测试与定价
Sep 22, 2026

Claude Opus 5.5:新特性、基准测试与定价

Claude Opus 5.5 详解:首款 Claude 5.5 模型,比 Opus 5 便宜 40%,输出速度提升 30%,全新智能体编程基准测试、定价及安全评分。

EigentEigent
GPT-6 Sol 和 Luna:OpenAI 更低价的编程与智能体模型
Sep 22, 2026

GPT-6 Sol 和 Luna:OpenAI 更低价的编程与智能体模型

GPT-6 Sol 和 Luna 是 OpenAI GPT-6 系列中低于 Astra 的新成员,大幅降价并强化编程能力。本文介绍具体变化、基准测试结果及各模型适用场景。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

立即体验 Eigent

下载开源桌面应用,在本地用 AI 工作团队开始自动化。

下载 Eigent
Eigent

获取关于 AI 员工自动化的最新更新和教程。

感谢订阅!

产品Eigent环境定价企业版
探索解决方案使用场景技能插件博客
开发者文档GitHubCAMEL-AI开源基金合作伙伴
下载开源版
公司关于我们品牌加入我们使用条款隐私政策安全与信任Cookie 政策退款与试用政策

保留所有权利 © 2026 EIGENT UK LTD