Claude Opus 5.5:新功能、基準測試與定價
Anthropic 首個 Claude 5.5 模型比 Opus 5 便宜 40%,領先代理編程基準測試,並創下最佳安全評分。

2026 年 9 月 22 日,Anthropic 發布了 Claude Opus 5.5,這是其全新 Claude 5.5 系列的首個模型。簡而言之:它在大多數工作上的表現與 Claude Fable 5.1 相當,運行成本比 Opus 5 低約 40%,輸出速度提升逾 30%,同時創下 Anthropic 迄今最佳安全評分。以下是實際的變化內容、基準測試結果、定價詳情,以及是否值得將您的代理切換過來。
什麼是 Claude Opus 5.5?
Claude Opus 5.5 是 Anthropic 的全新旗艦模型,也是 Claude 5.5 世代的首個發布版本。根據 Anthropic 的公告,它在最艱難的工作上——大型代碼庫遷移、多代碼倉庫工程及電腦使用任務——相比 Opus 5 有重大提升,同時每項任務所需的算力更少。
它還有另一個值得關注的地方:這是 Anthropic 自公司呼籲「放緩前沿發展步伐」以來的首個發布版本。這次的定位不再是「不惜代價追求原始能力」,而是「以更低成本、更安全的方式達到前沿水平的成果」。
Claude Sonnet 5.5 和 Haiku 5.5 預計將在未來數週內陸續推出,並帶來類似的改進。
Claude Opus 5.5 基準測試
在 Anthropic 公布的對比表中,Opus 5.5 在代理編程、電腦使用及知識工作方面均處於領先地位。除非另有說明,所有 Opus 5.5 數據均採用最大努力的自適應思考(adaptive thinking)模式。
| 基準測試 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0(代理編程) | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1, Main(代理編程) | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0(代理編程) | 57.8% | 51.8% | 46.6% | — |
| GDPval-AA v2.1(知識工作,Elo 分) | 1846 | 1735 | 1708 | 1542 |
| AutomationBench(業務工作流程) | 40.0% | 31.4% | 26.9% | 41.4% |
| Humanity's Last Exam(含工具) | 67.7% | 65.6% | 63.6% | 57.2% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
| OSWorld 2.0(電腦使用,部分) | 81.8% | 80.7% | 74.0% | — |
資料來源:Anthropic。
有兩點需要坦誠說明。第一,Anthropic 本身表示,在這個水平上,基準測試的差距對現實世界質量的參考價值較弱——在其實際使用中,Opus 5.5 與 Fable 5.1 之間的差距比分數所顯示的要小。第二,部分分數因安全防護措施而受到影響:在防護措施介入的任務上,網絡安全工作退回至 Opus 4.8,生物學工作退回至 Opus 5,這可能拉低了所報告的數字。
真正的亮點:效率
Opus 5.5 優勢最為明顯的地方在於每單位工作的成本。它每個 token 的費用更低,且每項任務所需的 token 數量更少,兩者疊加後達到 Anthropic 所宣傳的 40% 降幅。
編程方面的例子非常具體:
- 一位早期測試者在不到三小時內完成了一個 20 萬行代碼庫的審計和修復,而 Opus 5 需要超過 20 小時,且使用了 2.5 倍的 token。
- 另一位測試者在不到一天內完成了一個 68 萬行代碼的遷移——Anthropic 將這項工作定性為工程團隊需要數週才能完成的任務。
- 在一個將 HAProxy 從 C 語言重寫為 Rust 的內部項目中,Opus 5.5 用了 9.5 小時,而 Fable 5.1 需要 12 小時,且成本低 51%。
Anthropic 還報告稱,它在 FrontierCode 上以約 GPT-6 Astra 每項任務成本的 20% 超越了後者,並以約 40% 的成本在 Terminal-Bench 4.0 上與 Astra 持平。對於代理工作負載而言——您需要為多個步驟和大量重讀上下文付費——這種效率優勢會迅速累積。
Claude Opus 5.5 定價
Opus 5.5 在各方面的定價均低於 Opus 5:
| 每 100 萬 token | Opus 5.5 | Opus 5 |
|---|---|---|
| 輸入 | $4 | $5 |
| 輸出 | $20 | $25 |
| 緩存讀取 | $0.20 | $0.50 |
| 緩存寫入 | $5 | $6.25 |
緩存讀取的降幅對代理而言最為重要:每百萬 token 僅需 $0.20(降幅 60%),直接降低了在編程和多步驟代理賬單中佔主導地位的重讀密集型上下文成本。
此外,Claude Code 和 Claude Platform 還提供 Fast 模式,速度最高可達 2.5 倍,定價為每百萬 token 輸入 $8 / 輸出 $40。除降價之外,Anthropic 還提高了 Pro、Max 和 Team 計劃的五小時使用限額,並為訂閱用戶提供可自行選擇時機使用的速率限制重置功能。
安全性與回退機制
Anthropic 表示,Opus 5.5 是迄今為止在其自動化行為審計(最全面的對齊測試)中表現最強的模型。它比 Opus 5 更能抵抗提示注入(prompt injection),也更不容易採取難以撤銷的行動或超出既定邊界。它在發布前已由包括 METR 在內的外部評估機構進行了測試。
有一個值得注意的操作細節。由於 Opus 5.5 在生物學和網絡安全方面與 Claude Mythos 5.1 相當,它配備了 Fable 5.1 級別的安全防護措施——在某些雙重用途任務上,這些防護措施會將請求路由至舊版模型(Opus 4.8 或 Opus 5),而非直接作答。正如 The New Stack 所指出的,這意味著代理調用可能會在後台悄然回退至不同的模型。如果您正在基於 Opus 5.5 進行開發,了解這種情況何時會發生是很有必要的。
經過審核的機構現在可以申請加入 Anthropic 的生命科學驗證計劃(Life Sciences Verification Program),擴展的網絡安全驗證計劃(Cyber Verification Program)訪問權限將在未來數週內開放。
是否應該切換至 Opus 5.5?
按使用場景快速解讀:
- 長周期編程代理 — 很可能值得。token 效率加上 60% 更便宜的緩存讀取,正是針對多步驟、上下文密集型運行而設計的。
- 高流量、對成本敏感的工作負載 — 值得;40% 的成本降幅是將 Opus 5 流量遷移過來的主要理由。請在您的實際工作負載上進行測試,因為節省幅度取決於您的緩存讀取佔比。
- 對延遲敏感的應用 — 輸出速度提升 30%(或 Fast 模式)相比 Opus 5 是實實在在的提升。
- 雙重用途網絡安全/生物學工作 — 預計某些任務會因安全防護路由至舊版模型;請圍繞回退機制進行規劃,而非假設 Opus 5.5 能回答所有問題。
對大多數開發者而言,總結很簡單:接近 Fable 5.1 的質量,在過去成本高昂的工作負載上明顯更便宜、更快速,並配備了 Anthropic 迄今發布的最佳安全評分。
用您自己的 AI 工作團隊來完成這些任務
Opus 5.5 的最大優勢體現在長時間運行、工具密集型的工作上——全代碼庫遷移、審計、多代碼倉庫工程——這正是真實代理工作的形態。Eigent 是一款開源的「協作(Cowork)」桌面應用,可在本地運行多代理 AI 工作團隊,讓您能夠將 Claude Opus 5.5 等前沿模型應用於自己機器上的編程和研究工作流程。歡迎查看它如何處理多步驟工程任務,詳見我們的 GitHub PR 審查工作流程,或下載 Eigent,立即搭建您自己的代理。
Recent Posts

GPT-6 Sol 與 Luna:OpenAI 更具價格優勢的編程與智能代理模型
GPT-6 Sol 與 Luna 以大幅降價及更強編程能力,將 OpenAI GPT-6 系列延伸至 Astra 以下。本文涵蓋最新變化、基準測試結果,以及各模型的適用場景。

Periodic Neon:以實驗室數據訓練、超越前沿模型的科學AI
Periodic Neon 是一個以實體實驗室數據訓練的1兆參數AI,在衍射分析上超越GPT-6 Astra。本文介紹其功能及重要意義。

什麼是 Jev?TypeSafe AI 的 System One 模型詳解
TypeSafe AI 的 Jev 是一個 System One 模型,返回帶類型的概率決策而非文字。以下是其工作原理、費用及適用場景。