Claude Opus 5.5: Co nowego, benchmarki i cennik
Pierwszy model Claude 5.5 od Anthropic jest o 40% tańszy niż Opus 5, prowadzi w benchmarkach agentycznego kodowania i osiąga najlepsze dotychczas wyniki bezpieczeństwa.

22 września 2026 roku Anthropic wydało Claude Opus 5.5 – pierwszy model z nowej rodziny Claude 5.5. W skrócie: osiąga wyniki zbliżone do poziomu Claude Fable 5.1 w większości zadań, kosztuje około 40% mniej w eksploatacji niż Opus 5 i generuje wyniki ponad 30% szybciej. Osiąga też najlepsze dotychczas wyniki bezpieczeństwa Anthropic. Oto co faktycznie się zmieniło, co mówią benchmarki, ile to kosztuje i czy warto przenosić na niego swoje agenty.
Czym jest Claude Opus 5.5?
Claude Opus 5.5 to nowy flagowy model Anthropic i pierwsze wydanie generacji Claude 5.5. Zgodnie z ogłoszeniem Anthropic, to znaczący krok naprzód względem Opus 5 w najtrudniejszych zadaniach — migracje dużych baz kodu, inżynieria wielorepozytorium i zadania z użyciem komputera — przy jednoczesnym mniejszym zużyciu mocy obliczeniowej na zadanie.
Jest godny uwagi z jeszcze jednego powodu: to pierwsze wydanie Anthropic od czasu, gdy firma wezwała do „spowalniania wyścigu na granicy możliwości". Tym razem przekaz to nie „surowe możliwości za wszelką cenę", lecz „wyniki na poziomie frontier (czołowym), taniej i bezpieczniej."
Claude Sonnet 5.5 i Haiku 5.5 mają pojawić się w kolejnych tygodniach z podobnymi ulepszeniami.
Benchmarki Claude Opus 5.5
W opublikowanej przez Anthropic tabeli Opus 5.5 prowadzi w agentycznym kodowaniu, obsłudze komputera i pracy z wiedzą. Wszystkie wyniki Opus 5.5 korzystają z adaptacyjnego myślenia przy maksymalnym wysiłku, chyba że zaznaczono inaczej.
| Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 (agentyczne kodowanie) | 66,4% | 55,8% | 52,3% | 57,9% |
| FrontierCode v1.1, Main (agentyczne kodowanie) | 54,4% | 50,3% | 48,0% | 53,3% |
| CursorBench 4.0 (agentyczne kodowanie) | 57,8% | 51,8% | 46,6% | — |
| GDPval-AA v2.1 (praca z wiedzą, Elo) | 1846 | 1735 | 1708 | 1542 |
| AutomationBench (przepływy biznesowe) | 40,0% | 31,4% | 26,9% | 41,4% |
| Humanity's Last Exam (z narzędziami) | 67,7% | 65,6% | 63,6% | 57,2% |
| Terminal-Bench-Science 0.1 | 58,7% | 52,6% | 29,0% | 64,6% |
| OSWorld 2.0 (obsługa komputera, częściowy) | 81,8% | 80,7% | 74,0% | — |
Źródło: Anthropic.
Dwie uczciwe zastrzeżenia. Po pierwsze, samo Anthropic przyznaje, że na tym poziomie marginesy w benchmarkach są słabszym wyznacznikiem jakości w rzeczywistych zastosowaniach — w praktyce różnica między Opus 5.5 a Fable 5.1 jest mniejsza, niż sugerują wyniki. Po drugie, niektóre wyniki są obniżone przez zabezpieczenia: w zadaniach, gdzie interweniowały mechanizmy ochronne, praca z cyberbezpieczeństwem cofała się do Opus 4.8, a praca z biologią do Opus 5, co prawdopodobnie zaniżyło raportowane liczby.
Prawdziwa historia: efektywność
Przewaga Opus 5.5 jest najwyraźniejsza w koszcie na jednostkę pracy. Kosztuje mniej za token i zużywa mniej tokenów na zadanie, co daje łącznie nagłówkowy spadek o 40% według Anthropic.
Przykłady z kodowania są konkretne:
- Jeden z wczesnych testerów przeprowadził audyt i naprawił bazę kodu liczącą 200 000 linii w mniej niż trzy godziny, podczas gdy Opus 5 zajął ponad 20 godzin i zużył 2,5 razy więcej tokenów.
- Inny ukończył migrację kodu liczącego 680 000 linii w mniej niż jeden dzień — pracę, którą Anthropic określa jako tygodniowe zadanie dla zespołu inżynierów.
- Przy wewnętrznym przepisywaniu HAProxy z C na Rust, Opus 5.5 ukończył zadanie w 9,5 godziny wobec 12 godzin dla Fable 5.1 i kosztował 51% mniej.
Anthropic podaje również, że model bije GPT-6 Astra na FrontierCode przy około 20% kosztu na zadanie i dorównuje Astra na Terminal-Bench 4.0 za około 40% kosztu. W przypadku obciążeń agentycznych — gdzie płacisz za wiele kroków i dużo ponownie odczytywanego kontekstu — ta efektywność kumuluje się szybko.
Cennik Claude Opus 5.5
Opus 5.5 jest wyceniony poniżej Opus 5 we wszystkich kategoriach:
| Za 1M tokenów | Opus 5.5 | Opus 5 |
|---|---|---|
| Wejście | $4 | $5 |
| Wyjście | $20 | $25 |
| Odczyty z cache | $0,20 | $0,50 |
| Zapisy do cache | $5 | $6,25 |
Obniżka odczytu z cache jest najważniejsza dla agentów: przy $0,20 za milion (60% taniej) bezpośrednio obniża koszt kontekstu z intensywnym ponownym odczytem, który dominuje w rachunkach za kodowanie i wieloetapowych agentów.
Dostępny jest też tryb Fast w Claude Code i Claude Platform, działający do 2,5 raza szybciej, w cenie $8 wejście / $40 wyjście za milion tokenów. Oprócz obniżki cen Anthropic podniósł pięciogodzinne limity użytkowania w planach Pro, Max i Team oraz daje subskrybentom reset limitu szybkości, który mogą zachować i wykorzystać według własnego uznania.
Bezpieczeństwo i kwestia fallbacku
Anthropic twierdzi, że Opus 5.5 jest najlepiej działającym modelem do tej pory w automatycznym audycie behawioralnym — jego najbardziej kompleksowym teście wyrównania (alignment). Jest bardziej odporny na wstrzykiwanie promptów (prompt injection) niż Opus 5 i rzadziej podejmuje działania trudne do odwrócenia lub wykracza poza wyznaczone granice. Przed wydaniem był testowany przez zewnętrznych ewaluatorów, w tym METR.
Jest jeden szczegół operacyjny wart odnotowania. Ponieważ Opus 5.5 jest porównywalny z Claude Mythos 5.1 w biologii i cyberbezpieczeństwie, jest dostarczany z zabezpieczeniami klasy Fable 5.1 — i w przypadku niektórych zadań podwójnego zastosowania (dual-use) te zabezpieczenia kierują żądanie do starszego modelu (Opus 4.8 lub Opus 5) zamiast odpowiadać bezpośrednio. Jak zauważył The New Stack, oznacza to, że wywołanie agenta może po cichu cofnąć się do innego modelu w tle. Jeśli budujesz na Opus 5.5, warto wiedzieć, kiedy to może nastąpić.
Zweryfikowane organizacje mogą już teraz ubiegać się o udział w programie Life Sciences Verification Program Anthropic, a rozszerzony dostęp do Cyber Verification Program pojawi się w kolejnych tygodniach.
Czy warto przejść na Opus 5.5?
Szybka ocena według przypadku użycia:
- Agenty kodowania o długim horyzoncie — prawdopodobnie tak. Efektywność tokenów plus o 60% tańsze odczyty z cache są skierowane dokładnie na wieloetapowe, kontekstowo intensywne przebiegi.
- Obciążenia o dużej skali, wrażliwe na koszty — tak; 40% obniżka kosztów to główny powód, by przenieść ruch z Opus 5. Przetestuj na swoim rzeczywistym obciążeniu, ponieważ oszczędności zależą od udziału odczytów z cache.
- Aplikacje wrażliwe na opóźnienia — o 30% szybsze generowanie (lub tryb Fast) to realna korzyść względem Opus 5.
- Praca z cyberbezpieczeństwem/biologią podwójnego zastosowania — spodziewaj się przekierowania przez zabezpieczenia do starszych modeli w niektórych zadaniach; planuj z uwzględnieniem fallbacku, zamiast zakładać, że Opus 5.5 odpowiada na wszystko.
Dla większości twórców podsumowanie jest proste: jakość zbliżona do Fable 5.1, wyraźnie tańsza i szybsza w obciążeniach, które wcześniej były kosztowne, z najlepszymi wynikami bezpieczeństwa, jakie Anthropic kiedykolwiek wydało.
Zrób to z własną cyfrową siłą roboczą AI
Największe zyski Opus 5.5 ujawniają się w długotrwałych, intensywnie korzystających z narzędzi zadaniach — migracje całych baz kodu, audyty, inżynieria wielorepozytorium — co jest dokładnie kształtem prawdziwej pracy agentów. Eigent to open-source'owa aplikacja desktopowa „Cowork", która uruchamia lokalnie wieloagentową siłę roboczą AI, dzięki czemu możesz skierować modele frontier takie jak Claude Opus 5.5 na przepływy pracy z kodowaniem i badaniami na własnym komputerze. Zobacz, jak radzi sobie z wieloetapową inżynierią w naszym przepływie pracy do przeglądania PR-ów na GitHub lub pobierz Eigent i skonfiguruj własnych agentów już dziś.
Recent Posts

GPT-6 Sol i Luna: Tańsze modele OpenAI do kodowania i zadań agentycznych
GPT-6 Sol i Luna rozszerzają rodzinę GPT-6 poniżej Astry, oferując znaczne obniżki cen i lepsze możliwości kodowania. Oto co się zmieniło, wyniki benchmarków i kiedy używać każdego z nich.

Periodic Neon: Wytrenowany w Laboratorium Model AI, Który Bije Czołowe Modele w Nauce
Periodic Neon to model AI o 1 bilion parametrów wytrenowany na fizycznych danych laboratoryjnych, który przewyższa GPT-6 Astra w analizie dyfrakcji. Oto co robi i dlaczego ma to znaczenie.

Czym jest Jev? Model System One TypeSafe AI – wyjaśnienie
Jev od TypeSafe AI to model System One, który zwraca typowane, probabilistyczne decyzje zamiast tekstu. Jak działa, ile kosztuje i gdzie go zastosować.