Claude Opus 5.5:新功能、基準測試與定價
Anthropic 首款 Claude 5.5 模型比 Opus 5 便宜 40%,在代理編程基準測試中名列前茅,並創下最佳安全評分。

2026 年 9 月 22 日,Anthropic 發布了 Claude Opus 5.5,這是全新 Claude 5.5 系列的首款模型。簡而言之:它在大多數工作上的表現與 Claude Fable 5.1 相當,運行成本比 Opus 5 降低約 40%,輸出速度也提升超過 30%。此外,它還創下了 Anthropic 迄今最佳的安全評分。以下將詳細說明實際的變化內容、基準測試結果、定價方案,以及是否值得將您的代理切換至此版本。
什麼是 Claude Opus 5.5?
Claude Opus 5.5 是 Anthropic 的全新旗艦模型,也是 Claude 5.5 世代的首款發布。根據 Anthropic 的公告,它在最艱難的任務上——包括大型程式碼庫遷移、多儲存庫工程作業及電腦使用任務——相較 Opus 5 有重大躍進,同時每項任務所需的運算資源更少。
此次發布還有另一個值得關注的背景:這是 Anthropic 自該公司呼籲「放緩前沿發展步伐」以來的首次發布。這次的訴求不再是「不計代價追求原始能力」,而是「以更低成本、更高安全性達到前沿水準的成果」。
Claude Sonnet 5.5 與 Haiku 5.5 預計將在未來數週內陸續推出,並帶來類似的改進。
Claude Opus 5.5 基準測試
在 Anthropic 公布的對比表中,Opus 5.5 在代理編程(agentic coding)、電腦使用及知識工作方面均居領先地位。除非另有說明,所有 Opus 5.5 數據均採用最大努力的自適應思考(adaptive thinking)模式。
| 基準測試 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0(代理編程) | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1, Main(代理編程) | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0(代理編程) | 57.8% | 51.8% | 46.6% | — |
| GDPval-AA v2.1(知識工作,Elo 分) | 1846 | 1735 | 1708 | 1542 |
| AutomationBench(商業工作流程) | 40.0% | 31.4% | 26.9% | 41.4% |
| Humanity's Last Exam(含工具) | 67.7% | 65.6% | 63.6% | 57.2% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
| OSWorld 2.0(電腦使用,部分) | 81.8% | 80.7% | 74.0% | — |
資料來源:Anthropic。
有兩點需要坦誠說明。第一,Anthropic 自身也表示,在這個水準上,基準測試的差距對實際品質的參考價值較為有限——在其內部使用中,Opus 5.5 與 Fable 5.1 之間的差距比分數所呈現的更小。第二,部分分數因安全防護機制而受到影響:在防護機制介入的任務中,網路安全工作退回至 Opus 4.8,生物學工作退回至 Opus 5,這可能拉低了公布的數字。
真正的亮點:效率
Opus 5.5 優勢最為明顯之處在於每單位工作的成本。它每個 token 的費用更低,且每項任務所需的 token 數量也更少,兩者相加便達到了 Anthropic 所宣稱的 40% 降幅。
以下是具體的編程案例:
- 一位早期測試者在不到三小時內完成了一個 200,000 行程式碼庫的審計與修復,而 Opus 5 需要超過 20 小時,且使用了 2.5 倍的 token 數量。
- 另一位測試者在不到一天內完成了 680,000 行程式碼的遷移——Anthropic 將這項工作定義為工程團隊需要數週才能完成的任務。
- 在一項將 HAProxy 從 C 語言重寫為 Rust 的內部測試中,Opus 5.5 耗時 9.5 小時,而 Fable 5.1 需要 12 小時,且成本降低了 51%。
Anthropic 還報告稱,在 FrontierCode 上,Opus 5.5 以約 GPT-6 Astra 五分之一的每任務成本超越了後者;在 Terminal-Bench 4.0 上,以約 40% 的成本與 Astra 持平。對於代理工作負載而言——需要為多個步驟和大量重複讀取的上下文付費——這種效率優勢會快速累積。
Claude Opus 5.5 定價
Opus 5.5 在各方面的定價均低於 Opus 5:
| 每 100 萬 token | Opus 5.5 | Opus 5 |
|---|---|---|
| 輸入 | $4 | $5 |
| 輸出 | $20 | $25 |
| 快取讀取 | $0.20 | $0.50 |
| 快取寫入 | $5 | $6.25 |
快取讀取的降幅對代理而言最為關鍵:每百萬 token 僅需 $0.20(降低 60%),直接降低了在編程和多步驟代理帳單中佔主導地位的重複讀取上下文成本。
此外,Claude Code 和 Claude Platform 還提供 Fast 模式,速度最高可達 2.5 倍,定價為每百萬 token 輸入 $8 / 輸出 $40。除了降價之外,Anthropic 還提高了 Pro、Max 和 Team 方案的五小時使用限制,並為訂閱者提供可自行選擇時機使用的速率限制重置功能。
安全性與退回機制說明
Anthropic 表示,Opus 5.5 是迄今在其自動化行為審計中表現最強的模型——這是其最全面的對齊測試。它比 Opus 5 更能抵抗提示注入(prompt injection),也更不容易採取難以撤銷的行動或超出既定邊界。它在發布前已由包括 METR 在內的外部評估機構進行測試。
有一個值得特別說明的操作細節。由於 Opus 5.5 在生物學和網路安全方面的能力與 Claude Mythos 5.1 相當,因此它配備了 Fable 5.1 等級的安全防護——在某些雙重用途任務上,這些防護機制會將請求路由至較舊的模型(Opus 4.8 或 Opus 5),而非直接回應。正如 The New Stack 所指出的,這意味著代理呼叫可能會在背景中悄悄退回至不同的模型。如果您正在基於 Opus 5.5 進行開發,了解這種情況何時可能發生是很重要的。
經過審核的組織現在可以申請加入 Anthropic 的生命科學驗證計畫(Life Sciences Verification Program),擴展的網路安全驗證計畫(Cyber Verification Program)存取權限將在未來數週內開放。
是否應該切換至 Opus 5.5?
依使用情境快速評估:
- 長期編程代理 — 很可能值得切換。token 效率加上 60% 更便宜的快取讀取,正是針對多步驟、上下文密集型運行所設計的。
- 高流量、成本敏感的工作負載 — 值得切換;40% 的成本降幅是將 Opus 5 流量遷移過來的主要理由。請在您的實際工作負載上進行測試,因為節省幅度取決於您的快取讀取比例。
- 對延遲敏感的應用程式 — 輸出速度提升 30%(或 Fast 模式)相較 Opus 5 是實質性的改進。
- 雙重用途網路安全/生物學工作 — 預期在某些任務上會有安全防護路由至較舊模型的情況;請針對退回機制進行規劃,而非假設 Opus 5.5 能回應所有請求。
對大多數開發者而言,結論很簡單:接近 Fable 5.1 的品質,在過去成本高昂的工作負載上明顯更便宜、更快速,並且配備了 Anthropic 迄今發布的最佳安全評分。
用您自己的 AI 工作團隊來實現這一切
Opus 5.5 的最大優勢體現在長時間運行、工具密集型的任務上——例如全程式碼庫遷移、審計、多儲存庫工程作業——這正是真實代理工作的典型形態。Eigent 是一款開源的「協作」桌面應用程式,可在本地運行多代理 AI 工作團隊,讓您能夠將 Claude Opus 5.5 等前沿模型應用於自己機器上的編程和研究工作流程。歡迎參閱我們的 GitHub PR 審查工作流程,了解它如何處理多步驟工程任務,或立即下載 Eigent,自行配置您的代理。
Recent Posts

GPT-6 Sol 與 Luna:OpenAI 更具成本效益的程式開發與智能代理模型
GPT-6 Sol 與 Luna 是 OpenAI GPT-6 系列中定位低於 Astra 的新成員,大幅降低價格並強化程式開發能力。本文說明更新內容、基準測試結果,以及各模型的適用情境。

Periodic Neon:以實驗室數據訓練、超越前沿模型的 AI 科學家
Periodic Neon 是一個以實體實驗室數據訓練的 1T 參數 AI,在繞射分析上超越 GPT-6 Astra。本文說明其功能與重要性。

什麼是 Jev?TypeSafe AI 的 System One 模型解析
TypeSafe AI 的 Jev 是一種 System One 模型,回傳型別化、機率性決策而非文字。以下說明其運作方式、費用及適用場景。