Claude Opus 5.5: O Que Há de Novo, Benchmarks e Preços
O primeiro modelo Claude 5.5 da Anthropic é 40% mais barato que o Opus 5, lidera benchmarks de codificação agêntica e registra seus melhores índices de segurança.

Em 22 de setembro de 2026, a Anthropic lançou o Claude Opus 5.5, o primeiro modelo de sua nova família Claude 5.5. O resumo: ele performa em nível aproximado ao do Claude Fable 5.1 na maioria das tarefas, custa cerca de 40% menos para rodar do que o Opus 5 e gera saída mais de 30% mais rápido. Ele também registra os melhores índices de segurança da Anthropic até hoje. Veja o que realmente mudou, o que os benchmarks dizem, quanto custa e se vale a pena migrar seus agentes.
O que é o Claude Opus 5.5?
O Claude Opus 5.5 é o novo modelo principal da Anthropic e o lançamento inaugural da geração Claude 5.5. De acordo com o anúncio da Anthropic, é um grande avanço em relação ao Opus 5 nas tarefas mais difíceis — migrações extensas de bases de código, engenharia em múltiplos repositórios e tarefas de uso do computador — enquanto consome menos processamento por tarefa.
Ele se destaca por um segundo motivo: é o primeiro lançamento da Anthropic desde que a empresa defendeu "desacelerar a fronteira". A proposta desta vez é menos "capacidade bruta a qualquer custo" e mais "resultados de ponta, mais baratos e seguros."
O Claude Sonnet 5.5 e o Haiku 5.5 estão previstos para as próximas semanas, com melhorias semelhantes.
Benchmarks do Claude Opus 5.5
Na tabela publicada pela Anthropic, o Opus 5.5 lidera em codificação agêntica, uso do computador e trabalho de conhecimento. Todos os valores do Opus 5.5 utilizam pensamento adaptativo com esforço máximo, salvo indicação em contrário.
| Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 (codificação agêntica) | 66,4% | 55,8% | 52,3% | 57,9% |
| FrontierCode v1.1, Main (codificação agêntica) | 54,4% | 50,3% | 48,0% | 53,3% |
| CursorBench 4.0 (codificação agêntica) | 57,8% | 51,8% | 46,6% | — |
| GDPval-AA v2.1 (trabalho de conhecimento, Elo) | 1846 | 1735 | 1708 | 1542 |
| AutomationBench (fluxos de trabalho empresariais) | 40,0% | 31,4% | 26,9% | 41,4% |
| Humanity's Last Exam (com ferramentas) | 67,7% | 65,6% | 63,6% | 57,2% |
| Terminal-Bench-Science 0.1 | 58,7% | 52,6% | 29,0% | 64,6% |
| OSWorld 2.0 (uso do computador, parcial) | 81,8% | 80,7% | 74,0% | — |
Fonte: Anthropic.
Duas ressalvas honestas. Primeiro, a própria Anthropic afirma que, nesse nível, as margens dos benchmarks são um guia mais fraco para a qualidade no mundo real — em seu próprio uso, a diferença entre o Opus 5.5 e o Fable 5.1 é menor do que os números sugerem. Segundo, algumas pontuações são limitadas por salvaguardas: em tarefas onde as proteções intervieram, o trabalho de cibersegurança regrediu para o Opus 4.8 e o de biologia para o Opus 5, o que provavelmente reduziu os números reportados.
A história real: eficiência
Onde a vantagem do Opus 5.5 é mais clara é no custo por unidade de trabalho. Ele custa menos por token e usa menos tokens por tarefa, o que resulta na redução de 40% anunciada pela Anthropic.
Os exemplos de codificação são concretos:
- Um testador inicial auditou e corrigiu uma base de código de 200.000 linhas em menos de três horas, enquanto o Opus 5 levou mais de 20 horas e usou 2,5 vezes mais tokens.
- Outro concluiu uma migração de código de 680.000 linhas em menos de um dia — um trabalho que a Anthropic descreve como semanas para uma equipe de engenharia.
- Em uma reescrita interna de C para Rust do HAProxy, o Opus 5.5 terminou em 9,5 horas contra 12 do Fable 5.1, e custou 51% menos.
A Anthropic também relata que supera o GPT-6 Astra no FrontierCode a aproximadamente 20% do custo por tarefa, e iguala o Astra no Terminal-Bench 4.0 por cerca de 40% do custo. Para cargas de trabalho agênticas — onde você paga por muitas etapas e muito contexto relido — essa eficiência se multiplica rapidamente.
Preços do Claude Opus 5.5
O Opus 5.5 tem preços abaixo do Opus 5 em todos os aspectos:
| Por 1M de tokens | Opus 5.5 | Opus 5 |
|---|---|---|
| Entrada | $4 | $5 |
| Saída | $20 | $25 |
| Leituras de cache | $0,20 | $0,50 |
| Gravações de cache | $5 | $6,25 |
O corte nas leituras de cache é o que mais importa para agentes: a $0,20 por milhão (60% mais barato), ele reduz diretamente o custo do contexto de releitura intensiva que domina as contas de codificação e agentes de múltiplas etapas.
Há também um modo Rápido (Fast mode) no Claude Code e na Plataforma Claude, rodando até 2,5 vezes mais rápido, a $8 de entrada / $40 de saída por milhão de tokens. Além da redução de preço, a Anthropic elevou os limites de uso de cinco horas nos planos Pro, Max e Team e está oferecendo aos assinantes uma redefinição de limite de taxa que pode ser salva e usada quando quiserem.
Segurança e a ressalva do fallback
A Anthropic afirma que o Opus 5.5 é o modelo com melhor desempenho até hoje em sua auditoria comportamental automatizada — seu teste de alinhamento mais abrangente. Ele é mais resistente a injeção de prompt (prompt injection) do que o Opus 5 e menos propenso a tomar ações difíceis de reverter ou a agir fora dos limites estabelecidos. Foi testado antes do lançamento por avaliadores externos, incluindo a METR.
Há um detalhe operacional que vale destacar. Como o Opus 5.5 é comparável ao Claude Mythos 5.1 em biologia e cibersegurança, ele é lançado com salvaguardas de nível Fable 5.1 — e em algumas tarefas de uso dual, essas salvaguardas redirecionam a solicitação para um modelo mais antigo (Opus 4.8 ou Opus 5) em vez de responder diretamente. Como The New Stack observou, isso significa que uma chamada de agente pode silenciosamente recair sobre um modelo diferente em segundo plano. Se você está desenvolvendo com o Opus 5.5, vale saber quando isso pode acontecer.
Organizações verificadas podem se inscrever no Programa de Verificação de Ciências da Vida da Anthropic agora, com acesso expandido ao Programa de Verificação Cibernética chegando nas próximas semanas.
Vale a pena migrar para o Opus 5.5?
Uma leitura rápida por caso de uso:
- Agentes de codificação de longo horizonte — provavelmente sim. A eficiência de tokens somada às leituras de cache 60% mais baratas é voltada exatamente para execuções de múltiplas etapas com contexto extenso.
- Cargas de trabalho de alto volume e sensíveis a custo — sim; a redução de 40% no custo é o principal motivo para migrar o tráfego do Opus 5. Teste com sua carga de trabalho real, pois a economia depende da sua proporção de leituras de cache.
- Aplicações sensíveis à latência — a saída 30% mais rápida (ou o modo Rápido) é um ganho real em relação ao Opus 5.
- Trabalho dual de cibersegurança/biologia — espere roteamento por salvaguardas para modelos mais antigos em algumas tarefas; planeje em torno do fallback em vez de assumir que o Opus 5.5 responde tudo.
Para a maioria dos desenvolvedores, o resumo é simples: qualidade próxima ao Fable 5.1, claramente mais barato e rápido nas cargas de trabalho que antes eram caras, com os melhores índices de segurança que a Anthropic já lançou.
Faça isso com sua própria força de trabalho de IA
Os maiores ganhos do Opus 5.5 aparecem em tarefas de longa duração e com uso intenso de ferramentas — migrações em toda a base de código, auditorias, engenharia em múltiplos repositórios — que é exatamente o formato do trabalho real com agentes. O Eigent é um aplicativo desktop "Cowork" de código aberto que executa uma força de trabalho de IA multi-agente localmente, para que você possa direcionar modelos de ponta como o Claude Opus 5.5 para fluxos de trabalho de codificação e pesquisa na sua própria máquina. Veja como ele lida com engenharia de múltiplas etapas em nosso fluxo de trabalho de revisão de PRs no GitHub, ou baixe o Eigent e configure seus próprios agentes hoje mesmo.
Recent Posts

GPT-6 Sol e Luna: Os Modelos de Codificação e Agentes da OpenAI com Preços Mais Baixos
GPT-6 Sol e Luna expandem a família GPT-6 da OpenAI abaixo do Astra com grandes reduções de preço e melhor desempenho em codificação. Veja o que mudou, os benchmarks e quando usar cada um.

Periodic Neon: A IA Treinada em Laboratório que Supera os Modelos de Fronteira em Ciência
O Periodic Neon é uma IA com 1T de parâmetros treinada em dados físicos de laboratório que supera o GPT-6 Astra na análise de difração. Veja o que ele faz e por que isso é importante.

O Que É o Jev? O Modelo System One da TypeSafe AI, Explicado
O Jev da TypeSafe AI é um modelo System One que retorna decisões tipadas e probabilísticas em vez de texto. Veja como funciona, quanto custa e onde ele se encaixa.