Claude Opus 5.5: Neuerungen, Benchmarks und Preise
Anthropics erstes Claude-5.5-Modell ist 40 % günstiger als Opus 5, führt agentenbasierte Coding-Benchmarks an und erzielt die bisher besten Safety-Scores.

Am 22. September 2026 veröffentlichte Anthropic Claude Opus 5.5, das erste Modell der neuen Claude-5.5-Familie. Kurz zusammengefasst: Es erbringt auf den meisten Aufgaben in etwa die Leistung von Claude Fable 5.1, kostet im Betrieb rund 40 % weniger als Opus 5 und generiert Ausgaben mehr als 30 % schneller. Außerdem erzielt es Anthropics bisher beste Safety-Scores. Hier erfahren Sie, was sich tatsächlich geändert hat, was die Benchmarks zeigen, was es kostet und ob es sich lohnt, Ihre Agenten umzustellen.
Was ist Claude Opus 5.5?
Claude Opus 5.5 ist Anthropics neues Flaggschiff-Modell und die erste Veröffentlichung der Claude-5.5-Generation. Laut Anthropics Ankündigung ist es ein bedeutender Fortschritt gegenüber Opus 5 bei den anspruchsvollsten Aufgaben — umfangreiche Codebase-Migrationen, Multi-Repo-Engineering und Computer-Use-Aufgaben — bei gleichzeitig geringerem Rechenaufwand pro Aufgabe.
Es ist aus einem zweiten Grund bemerkenswert: Es ist Anthropics erste Veröffentlichung, seit das Unternehmen ein „Pacing the Frontier" gefordert hat. Das Versprechen lautet diesmal weniger „maximale Leistung zu jedem Preis", sondern vielmehr „Frontier-Ergebnisse, günstiger und sicherer."
Claude Sonnet 5.5 und Haiku 5.5 sollen in den kommenden Wochen mit ähnlichen Verbesserungen folgen.
Claude Opus 5.5 Benchmarks
In Anthropics veröffentlichter Tabelle führt Opus 5.5 bei agentenbasiertem Coding, Computer Use und Wissensarbeit. Alle Opus-5.5-Werte verwenden adaptives Denken mit maximaler Anstrengung, sofern nicht anders angegeben.
| Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 (agentenbasiertes Coding) | 66,4 % | 55,8 % | 52,3 % | 57,9 % |
| FrontierCode v1.1, Main (agentenbasiertes Coding) | 54,4 % | 50,3 % | 48,0 % | 53,3 % |
| CursorBench 4.0 (agentenbasiertes Coding) | 57,8 % | 51,8 % | 46,6 % | — |
| GDPval-AA v2.1 (Wissensarbeit, Elo) | 1846 | 1735 | 1708 | 1542 |
| AutomationBench (Geschäfts-Workflows) | 40,0 % | 31,4 % | 26,9 % | 41,4 % |
| Humanity's Last Exam (mit Tools) | 67,7 % | 65,6 % | 63,6 % | 57,2 % |
| Terminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 29,0 % | 64,6 % |
| OSWorld 2.0 (Computer Use, partiell) | 81,8 % | 80,7 % | 74,0 % | — |
Quelle: Anthropic.
Zwei ehrliche Einschränkungen. Erstens sagt Anthropic selbst, dass auf diesem Niveau Benchmark-Abstände ein schwächerer Indikator für reale Qualität sind — im eigenen Einsatz ist der Unterschied zwischen Opus 5.5 und Fable 5.1 geringer als die Werte vermuten lassen. Zweitens werden einige Scores durch Sicherheitsmechanismen (Safeguards) zurückgehalten: Bei Aufgaben, bei denen Guardrails eingriffen, fiel die Cybersecurity-Arbeit auf Opus 4.8 und die Biologie-Arbeit auf Opus 5 zurück, was die gemeldeten Zahlen wahrscheinlich gesenkt hat.
Die eigentliche Geschichte: Effizienz
Der deutlichste Vorteil von Opus 5.5 liegt bei den Kosten pro Arbeitseinheit. Es kostet weniger pro Token und verwendet weniger Token pro Aufgabe, was in Anthropics kommunizierten 40 % Einsparung resultiert.
Die Coding-Beispiele sind konkret:
- Ein früher Tester prüfte und korrigierte eine 200.000-Zeilen-Codebase in unter drei Stunden, während Opus 5 über 20 Stunden benötigte und 2,5-mal so viele Token verwendete.
- Ein anderer schloss eine 680.000-Zeilen-Code-Migration in weniger als einem Tag ab — eine Arbeit, die Anthropic als wochenlange Aufgabe für ein Engineering-Team einordnet.
- Bei einem internen C-zu-Rust-Rewrite von HAProxy benötigte Opus 5.5 9,5 Stunden gegenüber 12 für Fable 5.1 und kostete 51 % weniger.
Anthropic berichtet außerdem, dass es GPT-6 Astra bei FrontierCode bei etwa 20 % der Kosten pro Aufgabe übertrifft und Astra bei Terminal-Bench 4.0 für etwa 40 % der Kosten einholt. Bei agentenbasierten Workloads — bei denen Sie für viele Schritte und viel wiedergelesenen Kontext bezahlen — potenziert sich diese Effizienz schnell.
Claude Opus 5.5 Preise
Opus 5.5 ist durchgehend günstiger als Opus 5:
| Pro 1 Mio. Token | Opus 5.5 | Opus 5 |
|---|---|---|
| Eingabe | 4 $ | 5 $ |
| Ausgabe | 20 $ | 25 $ |
| Cache-Lesezugriffe | 0,20 $ | 0,50 $ |
| Cache-Schreibzugriffe | 5 $ | 6,25 $ |
Die Senkung der Cache-Lesezugriffe ist die wichtigste für Agenten: Bei 0,20 $ pro Million (60 % günstiger) senkt sie direkt die Kosten des wiederholten Kontextlesens, das Coding- und mehrstufige Agenten-Abrechnungen dominiert.
Es gibt außerdem einen Fast Mode in Claude Code und der Claude Platform, der bis zu 2,5-mal schneller läuft, zu 8 $ Eingabe / 40 $ Ausgabe pro Million Token. Zusätzlich zur Preissenkung hat Anthropic die Fünf-Stunden-Nutzungslimits für Pro-, Max- und Team-Pläne angehoben und gibt Abonnenten ein Rate-Limit-Reset, das sie speichern und nach Bedarf einsetzen können.
Safety und der Fallback-Vorbehalt
Anthropic gibt an, dass Opus 5.5 das bisher leistungsstärkste Modell bei seinem automatisierten Verhaltens-Audit ist — seinem umfassendsten Alignment-Test. Es ist widerstandsfähiger gegen Prompt Injection als Opus 5 und weniger geneigt, schwer umkehrbare Aktionen durchzuführen oder die vorgegebenen Grenzen zu überschreiten. Es wurde vor der Veröffentlichung von externen Evaluatoren einschließlich METR getestet.
Es gibt ein operatives Detail, das erwähnenswert ist. Da Opus 5.5 mit Claude Mythos 5.1 in Biologie und Cybersecurity vergleichbar ist, wird es mit Fable-5.1-Safeguards ausgeliefert — und bei einigen Dual-Use-Aufgaben leiten diese Safeguards die Anfrage an ein älteres Modell (Opus 4.8 oder Opus 5) weiter, anstatt direkt zu antworten. Wie The New Stack feststellte, bedeutet das, dass ein Agenten-Aufruf im Hintergrund stillschweigend auf ein anderes Modell zurückfallen kann. Wenn Sie auf Opus 5.5 aufbauen, lohnt es sich zu wissen, wann das passieren kann.
Geprüfte Organisationen können sich jetzt für Anthropics Life Sciences Verification Program bewerben; der erweiterte Zugang zum Cyber Verification Program folgt in den kommenden Wochen.
Sollten Sie zu Opus 5.5 wechseln?
Eine schnelle Einschätzung nach Anwendungsfall:
- Langfristige Coding-Agenten — wahrscheinlich ja. Die Token-Effizienz plus die 60 % günstigeren Cache-Lesezugriffe zielen genau auf mehrstufige, kontextintensive Läufe ab.
- Hochvolumige, kostensensitive Workloads — ja; die 40 % Kostensenkung ist der Hauptgrund, Opus-5-Traffic umzustellen. Testen Sie mit Ihrem echten Workload, da die Einsparungen von Ihrem Cache-Read-Anteil abhängen.
- Latenzempfindliche Anwendungen — die 30 % schnellere Ausgabe (oder der Fast Mode) ist ein echter Gewinn gegenüber Opus 5.
- Dual-Use-Cyber/Bio-Arbeit — rechnen Sie bei einigen Aufgaben mit Safeguard-Routing zu älteren Modellen; planen Sie um den Fallback herum, anstatt davon auszugehen, dass Opus 5.5 alles beantwortet.
Für die meisten Entwickler lautet die Zusammenfassung einfach: nahezu Fable-5.1-Qualität, deutlich günstiger und schneller bei den Workloads, die früher teuer waren, mit den besten Safety-Scores, die Anthropic je veröffentlicht hat.
Nutzen Sie das mit Ihrer eigenen KI-Belegschaft
Die größten Gewinne von Opus 5.5 zeigen sich bei langfristigen, tool-intensiven Aufgaben — codebase-weite Migrationen, Audits, Multi-Repo-Engineering — was genau der Charakter echter Agenten-Arbeit ist. Eigent ist eine Open-Source-„Cowork"-Desktop-App, die eine Multi-Agenten-KI-Belegschaft lokal ausführt, sodass Sie Frontier-Modelle wie Claude Opus 5.5 auf Coding- und Recherche-Workflows auf Ihrem eigenen Rechner ansetzen können. Sehen Sie, wie es mehrstufiges Engineering in unserem GitHub-PRs-Review-Workflow handhabt, oder laden Sie Eigent herunter und richten Sie noch heute Ihre eigenen Agenten ein.
Recent Posts

GPT-6 Sol und Luna: OpenAIs günstigere Coding- und Agentic-Modelle
GPT-6 Sol und Luna erweitern OpenAIs GPT-6-Familie unterhalb von Astra mit deutlichen Preissenkungen und verbessertem Coding. Hier sind die Änderungen, die Benchmarks und wann man welches Modell einsetzt.

Periodic Neon: Die im Labor trainierte KI, die Frontier-Modelle in der Wissenschaft übertrifft
Periodic Neon ist eine 1T-Parameter-KI, die auf physischen Labordaten trainiert wurde und GPT-6 Astra bei der Beugungsanalyse übertrifft. Was das Modell leistet und warum es bedeutsam ist.

Was ist Jev? TypeSafe AIs System-One-Modell, erklärt
TypeSafe AIs Jev ist ein System-One-Modell, das typisierte, probabilistische Entscheidungen statt Text zurückgibt. So funktioniert es, was es kostet und wo es seinen Platz hat.