Claude Opus 5.5:新特性、基准测试与定价
Anthropic 首款 Claude 5.5 模型比 Opus 5 便宜 40%,在智能体编程基准测试中名列前茅,并创下最佳安全评分。

2026 年 9 月 22 日,Anthropic 发布了 Claude Opus 5.5,这是其全新 Claude 5.5 系列的首款模型。简而言之:它在大多数任务上的表现与 Claude Fable 5.1 相当,运行成本比 Opus 5 降低约 40%,输出速度提升超过 30%,同时创下 Anthropic 迄今最佳安全评分。以下是实际变化内容、基准测试结果、定价信息,以及是否值得将智能体迁移至该模型的分析。
什么是 Claude Opus 5.5?
Claude Opus 5.5 是 Anthropic 的新旗舰模型,也是 Claude 5.5 世代的首款发布产品。根据 Anthropic 的公告,它在最复杂的任务上——包括大型代码库迁移、多仓库工程和计算机使用任务——相比 Opus 5 有重大提升,同时每项任务消耗的算力更少。
该模型还有另一个值得关注的背景:这是 Anthropic 自公司呼吁"放缓前沿发展步伐"以来的首次发布。这次的定位不再是"不惜代价追求原始能力",而是"以更低成本、更高安全性实现前沿级别的结果"。
Claude Sonnet 5.5 和 Haiku 5.5 预计将在未来数周内陆续发布,并带来类似改进。
Claude Opus 5.5 基准测试
在 Anthropic 公布的对比表中,Opus 5.5 在智能体编程、计算机使用和知识工作方面均处于领先地位。除特别说明外,所有 Opus 5.5 数据均在最大努力模式下使用自适应思考(adaptive thinking)得出。
| 基准测试 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0(智能体编程) | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1, Main(智能体编程) | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0(智能体编程) | 57.8% | 51.8% | 46.6% | — |
| GDPval-AA v2.1(知识工作,Elo 分) | 1846 | 1735 | 1708 | 1542 |
| AutomationBench(业务工作流) | 40.0% | 31.4% | 26.9% | 41.4% |
| Humanity's Last Exam(含工具) | 67.7% | 65.6% | 63.6% | 57.2% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
| OSWorld 2.0(计算机使用,部分) | 81.8% | 80.7% | 74.0% | — |
数据来源:Anthropic。
有两点需要客观说明。第一,Anthropic 自身也指出,在这一水平上,基准测试的差距对实际质量的参考价值有限——在其内部使用中,Opus 5.5 与 Fable 5.1 之间的差距比分数所呈现的要小。第二,部分分数受到安全防护机制的影响:在防护措施介入的任务中,网络安全工作回退至 Opus 4.8,生物学工作回退至 Opus 5,这可能拉低了报告中的数字。
核心优势:效率
Opus 5.5 优势最为明显的地方在于单位工作的成本。它每个 token 的价格更低,同时每项任务消耗的 token 也更少,两者叠加实现了 Anthropic 宣传的 40% 成本降幅。
以下是具体的编程案例:
- 一位早期测试者在不到三小时内完成了一个 20 万行代码库的审计和修复,而 Opus 5 完成同样工作需要超过 20 小时,且消耗的 token 数量是前者的 2.5 倍。
- 另一位测试者在不到一天内完成了 68 万行代码的迁移——Anthropic 将此类工作定性为工程团队需要数周才能完成的任务。
- 在内部将 HAProxy 从 C 语言重写为 Rust 的项目中,Opus 5.5 用 9.5 小时完成,而 Fable 5.1 需要 12 小时,且成本降低了 51%。
Anthropic 还报告称,在 FrontierCode 上,Opus 5.5 以约 GPT-6 Astra 20% 的任务成本超越了后者;在 Terminal-Bench 4.0 上,以约 40% 的成本与 Astra 持平。对于智能体工作负载而言——需要为大量步骤和频繁重读上下文付费——这种效率优势会快速累积放大。
Claude Opus 5.5 定价
Opus 5.5 在各项指标上均低于 Opus 5 的定价:
| 每 100 万 token | Opus 5.5 | Opus 5 |
|---|---|---|
| 输入 | $4 | $5 |
| 输出 | $20 | $25 |
| 缓存读取 | $0.20 | $0.50 |
| 缓存写入 | $5 | $6.25 |
缓存读取的降价对智能体而言意义最为重大:每百万 token 仅需 $0.20(降价 60%),直接降低了编程和多步骤智能体账单中占主导地位的重复读取上下文成本。
此外,Claude Code 和 Claude Platform 还提供 Fast 模式,速度最高可达标准模式的 2.5 倍,定价为每百万 token 输入 $8 / 输出 $40。除价格下调外,Anthropic 还提高了 Pro、Max 和 Team 套餐的五小时使用限额,并为订阅用户提供可自主选择使用时机的速率限制重置功能。
安全性与回退机制
Anthropic 表示,Opus 5.5 是其迄今在自动化行为审计(最全面的对齐测试)中表现最强的模型。它比 Opus 5 更能抵御提示注入(prompt injection)攻击,更不容易执行难以撤销的操作,也更不容易越出既定边界。该模型在发布前经过了包括 METR 在内的外部评估机构的测试。
有一个运营细节值得特别关注。由于 Opus 5.5 在生物学和网络安全领域的能力与 Claude Mythos 5.1 相当,它配备了 Fable 5.1 级别的安全防护——在某些双重用途任务上,这些防护措施会将请求路由至旧版模型(Opus 4.8 或 Opus 5),而非直接作答。正如 The New Stack 所指出的,这意味着智能体调用可能会在后台悄然回退至不同的模型。如果您正在基于 Opus 5.5 进行开发,了解何时会触发这种情况非常重要。
经过审核的组织现在可以申请加入 Anthropic 的生命科学验证计划(Life Sciences Verification Program),网络安全验证计划(Cyber Verification Program)的扩展访问权限将在未来数周内开放。
是否应该切换到 Opus 5.5?
按使用场景快速梳理:
- 长周期编程智能体 — 建议切换。token 效率提升加上缓存读取降价 60%,正是为多步骤、上下文密集型任务量身打造的。
- 高并发、成本敏感型工作负载 — 建议切换;40% 的成本降幅是将 Opus 5 流量迁移过来的核心理由。请在实际工作负载上进行测试,因为节省幅度取决于您的缓存读取占比。
- 对延迟敏感的应用 — 输出速度提升 30%(或 Fast 模式)相比 Opus 5 是实实在在的提升。
- 双重用途网络安全/生物学工作 — 预计部分任务会触发安全路由回退至旧版模型;请提前规划回退方案,而非假设 Opus 5.5 能处理所有请求。
对大多数开发者而言,结论很简单:接近 Fable 5.1 的质量,在过去成本高昂的工作负载上明显更便宜、更快速,并且拥有 Anthropic 迄今发布的最佳安全评分。
用您自己的 AI 工作团队来实现这一切
Opus 5.5 的最大收益体现在长时运行、工具密集型任务上——全代码库迁移、审计、多仓库工程——这正是真实智能体工作的典型形态。Eigent 是一款开源"协作"桌面应用,可在本地运行多智能体 AI 工作团队,让您能够将 Claude Opus 5.5 等前沿模型直接应用于自己机器上的编程和研究工作流。欢迎查看我们的 GitHub PR 审查工作流,了解它如何处理多步骤工程任务,或下载 Eigent,立即搭建您自己的智能体工作流。
Recent Posts

GPT-6 Sol 和 Luna:OpenAI 更低价的编程与智能体模型
GPT-6 Sol 和 Luna 是 OpenAI GPT-6 系列中低于 Astra 的新成员,大幅降价并强化编程能力。本文介绍具体变化、基准测试结果及各模型适用场景。

Periodic Neon:击败前沿模型的实验室训练AI科学家
Periodic Neon是一个在物理实验室数据上训练的1万亿参数AI,在衍射分析上超越了GPT-6 Astra。本文介绍其功能及重要意义。

什么是 Jev?TypeSafe AI 的 System One 模型详解
TypeSafe AI 的 Jev 是一种 System One 模型,返回类型化的概率决策而非文本。本文介绍其工作原理、定价及适用场景。