
Opus 5.5: O Que Mudou, Quanto Custa, Como Migrar e Por Que Ele Virou o Padrão Recomendado da Anthropic
Entre na sua conta para curtir e guardar o que gostou.
Opus 5.5: O Que Mudou, Quanto Custa, Como Migrar e Por Que Ele Virou o Padrão Recomendado da Anthropic
Entre na sua conta para curtir e guardar o que gostou.
Opus 5.5: O Que Mudou, Quanto Custa, Como Migrar e Por Que Ele Virou o Padrão Recomendado da Anthropic
0:00 / 21:42
O Claude Opus 5.5 chegou mais forte e 20% mais barato que o Opus 5, com leitura de cache 60% menor, e a documentação oficial passou a recomendá-lo como padrão. Os nove benchmarks (incluindo os dois que ele perde), a curva de esforço contra custo e o passo a passo de migração.
A Anthropic lançou o Claude Opus 5.5 hoje, 22 de setembro de 2026, e a notícia não é o benchmark: é a tabela de preço. O Opus 5.5 entrega mais que o Opus 5 custando menos que o Opus 5, e a documentação oficial passou a recomendá-lo como ponto de partida para a maioria das cargas de trabalho, lugar que até ontem era do Fable 5.1 por raciocínio e do Opus 5 por equilíbrio.
Eu uso Claude no meu trabalho todo dia e mantenho uma cadeia de fallback entre fornecedores no golber.net, então leio lançamento com a calculadora aberta, não com entusiasmo. Este post é o que a página do produto e a documentação de modelos dizem, com os números exatos, as ressalvas que a própria Anthropic publica, a conta de quanto muda na sua fatura e a decisão de migrar ou não, por tipo de uso.
O que é o Opus 5.5 e por que ele virou o padrão recomendado
Os nove benchmarks, incluindo os dois que ele perde
Preço: 20% mais barato que o Opus 5, e o cache que decide a conta
O parâmetro de esforço: o botão que controla custo e qualidade
Como migrar, e quando o Fable 5.1 continua sendo a escolha certa
O que é o Opus 5.5
O Claude Opus 5.5 é o novo modelo da Anthropic para codificação agêntica de longa duração e trabalho de conhecimento. Na API ele é o claude-opus-5-5, custa US$ 4 por milhão de tokens de entrada e US$ 20 de saída, tem janela de contexto de 1 milhão de tokens, saída máxima de 128 mil, raciocínio adaptativo sempre ativo com esforço padrão medium e corte de conhecimento confiável em junho de 2026.
A frase que mais importa não está no anúncio de marketing, está na documentação de modelos: se você não tem certeza de qual usar, comece pelo Opus 5.5 para a maioria das cargas; use o Fable 5.1 para raciocínio exigente e trabalho agêntico de longo horizonte, ou quando as suas avaliações no Opus 5.5 com esforço mais alto ainda não bastarem. Traduzindo: o Opus 5.5 é o novo padrão, e o Fable virou o caso especial.
A Anthropic descreve o modelo como um grande passo adiante do Opus 5, operando no nível do Fable 5.1 na maior parte do trabalho, com geração de saída 30% mais rápida que o Opus 5 e exigindo menos computação para ser servido. É daí que sai a queda de preço: não é promoção, é custo de servir menor repassado.
| Característica | Opus 5.5 | Fable 5.1 | Sonnet 5 | Haiku 4.5 |
|---|---|---|---|---|
| ID na API | claude-opus-5-5 | claude-fable-5-1 | claude-sonnet-5 | claude-haiku-4-5-20251001 |
| Entrada por 1M tokens | US$ 4 | US$ 10 | US$ 2 | US$ 1 |
| Saída por 1M tokens | US$ 20 | US$ 50 | US$ 10 | US$ 5 |
| Latência comparativa | Moderada | Mais lento | Rápido | Mais rápida |
| Esforço padrão | medium | high | high | Não suportado |
| Janela de contexto | 1M tokens | 1M tokens | 1M tokens | 200 mil |
| Saída máxima | 128 mil | 128 mil | 128 mil | 64 mil |
| Corte de conhecimento | jun/2026 | jun/2026 | jan/2026 | fev/2025 |
Todos os modelos atuais aceitam texto e imagem na entrada, devolvem texto, são multilíngues e usam ferramentas. O Opus 5.5 tem compromisso de aposentadoria não antes de 22 de setembro de 2027, ou seja, um ano de vida garantido para quem construir em cima dele.
Quando o modelo melhor fica mais barato que o anterior, a pergunta deixa de ser "vale a pena migrar" e vira "por que eu ainda não migrei".
Os números, e os dois que ele perde
O Opus 5.5 lidera sete dos nove benchmarks publicados no anúncio oficial, com a maior distância em codificação agêntica: 66,4% no Terminal-Bench 4.0 contra 55,8% do Fable 5.1, 52,3% do Opus 5 e 57,9% do GPT-6 Astra. Ele perde em dois, ambos para o Astra, e a própria Anthropic explica por quê em um deles.
| Avaliação | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 (codificação agêntica) | 66,4% | 55,8% | 52,3% | 57,9% | 37,3% |
| FrontierCode v1.1 (principal) | 54,4% | 50,3% | 48,0% | 53,3% | 47,5% |
| CursorBench 4.0 | 57,8% | 51,8% | 46,6% | não informado | 41,7% |
| GDPval-AA v2.1 (trabalho intelectual, Elo) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench (fluxos empresariais) | 40,0% | 31,4% | 26,9% | 41,4% | 28,8% |
| Humanity's Last Exam (com ferramentas) | 67,7% | 65,6% | 63,6% | 57,2% | não informado |
| Terminal-Bench Science 0.1 (pesquisa agêntica) | 58,7% | 52,6% | 29,0% | 64,6% | 22,4% |
| OSWorld 2.0 (uso de computador, parcial) | 81,8% | 80,7% | 74,0% | não informado | não informado |
| Cartografia (gráficos visuais, com ferramentas) | 89,0% | 88,4% | 83,4% | não informado | não informado |
As ressalvas, que estão nas notas do próprio anúncio e que quase ninguém vai reproduzir: o Terminal-Bench 4.0 tem erro padrão de ±2,6 pontos para o Opus 5.5, o que significa que diferenças de dois ou três pontos contra outro modelo não decidem nada. No AutomationBench, a medição foi feita sem modelos de reserva, então toda intervenção de proteção contou como falha e puxou a nota para baixo. E o modelo foi avaliado com as proteções de produção ligadas: quando elas intervieram em tarefas de cibersegurança, quem concluiu a tarefa foi o Opus 4.8.
Isso é mais honesto que a média do mercado, e é o tipo de detalhe que eu procuro antes de acreditar em tabela de lançamento. O mesmo ceticismo eu apliquei quando separei fato de boato nas polêmicas recentes de IA e quando li o anúncio do Jev, da TypeSafe AI, cujos números também são todos do próprio fabricante. Benchmark de lançamento serve para orientar teste, não para substituir teste.
A curva que importa: esforço contra custo
O gráfico mais relevante do anúncio não é o de pontuação, é o de pontuação por custo. No Terminal-Bench 4.0, o Opus 5.5 com esforço padrão supera o Opus 5 com esforço máximo por cerca de um quinto do custo, e se equipara ao GPT-6 Astra por cerca de 40% do custo. No GDPval-AA v2.1, que avalia agentes em trabalho profissional real de 44 ocupações, o Opus 5.5 com esforço médio já supera o GPT-6 Astra em esforço máximo, também por cerca de um quinto do custo por tarefa.
Isso muda a forma de usar o modelo. O parâmetro effort aceita low, medium, high, xhigh e max, e a curva publicada mostra retorno decrescente: no Terminal-Bench, o salto grande está entre low e high; de xhigh para max a pontuação praticamente empata e o custo por tentativa cresce. Ou seja, subir esforço sem medir é queimar dinheiro.
// O esforço é o botão de custo. Padrão do Opus 5.5 é "medium".
const resposta = await client.messages.create({
model: "claude-opus-5-5",
effort: "medium", // low | medium | high | xhigh | max
max_tokens: 4096,
messages: [{ role: "user", content: tarefa }],
});
// Regra prática: comece no padrão, meça acerto e custo por tarefa,
// e só suba o esforço onde a qualidade não bateu a sua régua.
A régua não é o benchmark deles, é o seu. Monte um conjunto de 200 a 300 tarefas reais da sua operação com a resposta certa dada por gente, rode em medium, meça acerto e custo por tarefa concluída, e só então decida se sobe. É a mesma disciplina que eu descrevi ao falar de o que quebra ao migrar para o GPT-6 Astra: trocar de modelo sem medição é trocar de fé.
Preço: 20% menos, e o cache decide
O Opus 5.5 custa US$ 4 por milhão de tokens de entrada e US$ 20 de saída, contra US$ 5 e US$ 25 do Opus 5. São 20% a menos nos dois. A leitura de cache caiu mais: US$ 0,20 contra US$ 0,50, uma queda de 60%. A escrita de cache saiu de US$ 6,25 para US$ 5. Existe ainda um modo rápido, a US$ 8 de entrada e US$ 40 de saída, e a API de lote continua com 50% de desconto.
| Por 1M tokens | Opus 5.5 | Opus 5 | Diferença |
|---|---|---|---|
| Entrada | US$ 4,00 | US$ 5,00 | 20% mais barato |
| Saída | US$ 20,00 | US$ 25,00 | 20% mais barato |
| Leitura de cache | US$ 0,20 | US$ 0,50 | 60% mais barato |
| Escrita de cache | US$ 5,00 | US$ 6,25 | 20% mais barato |
| Modo rápido (entrada / saída) | US$ 8 / US$ 40 | não se aplica | dobro do padrão |
O detalhe que muda a fatura de quem roda agente: a leitura de cache do Opus 5.5 sai a 5% do preço de entrada, enquanto no Fable 5.1 ela é 2,5%. Em proporção, o Fable desconta mais; em valor absoluto, o Opus 5.5 é mais barato, US$ 0,20 contra US$ 0,25. Como em conversa longa de agente o prefixo é relido dezenas de vezes, é esse número, e não o preço de tabela, que domina a conta. Eu já tinha mostrado essa lógica em o que mudou de verdade no Fable 5.1, quando o cache barateou quatro vezes.
Uma conta de exemplo, com números redondos para enxergar a proporção: um agente com prefixo de 100 mil tokens relido 50 vezes por dia gasta 5 milhões de tokens de leitura de cache por dia. No Opus 5, seria US$ 2,50 por dia; no Opus 5.5, US$ 1,00. Some a queda de 20% na saída e o relato de que o modelo escreve menos, e a economia real fica bem acima dos 20% da tabela.
Em agente, o preço que importa não é o da tabela: é o da leitura de cache vezes o número de vezes que você relê o mesmo prefixo.
Alinhamento e verbosidade no dia a dia
Além de velocidade e preço, a Anthropic destaca comportamento. Na auditoria comportamental automatizada, o Opus 5.5 é descrito como o modelo mais forte que eles testaram até hoje: menos propenso a tomar ações difíceis de reverter ou a agir fora dos limites, e com tentativas de contornar restrições 85% menos frequentes que no Opus 5. A empresa também afirma que ele é muito mais resistente a injeção de prompt que o Opus 5.
Para quem coloca agente com poder de escrita dentro de um sistema real, isso vale mais que ponto de benchmark. Agente que age fora do combinado é o risco número um de qualquer integração, e eu escrevi sobre esse desenho de limites em WebMCP no Next.js: deixar o site pronto para agentes. Modelo mais resistente não substitui permissão, limite e registro; só reduz a frequência com que você precisa deles.
Sobre verbosidade, a Anthropic cita relatos de clientes: a Box afirma que o modelo é 40% menos verboso mantendo a precisão, e a Factory diz que ele usa de 20% a 25% menos tokens de saída. São números de terceiros citados pelo fornecedor, não medição independente, mas apontam na mesma direção da queda de preço: menos token de saída, que é o token caro. Na prática, quem usa Claude Code todo dia sente isso como resposta mais curta e mais bem estruturada, e como limite semanal durando mais.
Onde ele está disponível
O Opus 5.5 está na API da Anthropic como claude-opus-5-5, no Claude Code e na plataforma, e nas três grandes nuvens: Amazon Web Services, Google Cloud e Microsoft Azure. Nos planos de consumo, ele chega para Pro, Max, Team e Enterprise, com os limites da janela de cinco horas aumentados.
Quem usa Claude Code com assinatura sente o efeito do limite antes de sentir o do preço, e a mudança de limite vem junto com um modelo que gasta menos token de saída. Já expliquei como esse teto funciona e como não bater nele em Claude Code: a promoção acabou, mas 25% ficou para sempre. Nas nuvens, os identificadores acompanham o padrão de sempre: anthropic.claude-opus-5-5 no Bedrock e claude-opus-5-5 no Vertex e no Foundry.
Um detalhe para quem gera documento longo: a saída máxima síncrona é de 128 mil tokens, mas na API de lote os modelos atuais aceitam até 300 mil tokens de saída com o cabeçalho beta próprio. Para relatório gigante, lote sai pela metade do preço e com mais espaço.
Como migrar, e quando não migrar
Migrar do Opus 5 para o Opus 5.5 é trocar o identificador do modelo e medir. Não há mudança de preço para pior, o contexto e a saída são os mesmos, e o esforço padrão passa a ser medium. O risco real não é técnico, é de expectativa: como o modelo escreve menos e age com mais cautela, prompts calibrados para a verbosidade anterior podem precisar de ajuste.
Troque o modelo em um ambiente de teste, não em produção. Rode o seu conjunto de tarefas reais no Opus 5.5 em
mediume no modelo atual, lado a lado.Meça custo por tarefa concluída, não por token. Token mais barato com mais tentativas pode sair mais caro. O que importa é quanto custou terminar a tarefa certa.
Revise os prompts de formato. Se o seu sistema esperava resposta longa e passou a receber resposta curta, o problema é a instrução, não o modelo.
Ajuste o esforço por tipo de tarefa. Rotina em
lowoumedium, tarefa difícil emhigh. Subir paramaxsó com evidência de que a qualidade melhora.Confira o cache. Se o seu prefixo é estável, a queda de 60% na leitura é a maior economia do lançamento; se ele muda a cada chamada, você não vai ver essa economia.
Revise o que o modelo escreve. Modelo melhor não dispensa leitura: em código gerado por IA, quase metade das amostras reprova em segurança, como mostrei em programar com IA não é copiar e colar.
E quando não migrar: se o seu caso é raciocínio exigente de longo horizonte e as suas avaliações no Opus 5.5, mesmo em esforço alto, ainda ficam abaixo do Fable 5.1, a recomendação oficial é continuar no Fable. Se o seu gargalo é latência pura, o Sonnet 5 é rápido e custa US$ 2 e US$ 10. Se é volume enorme de tarefa simples, o Haiku 4.5 sai por US$ 1 e US$ 5. O erro caro é usar o modelo mais forte para tarefa que um modelo menor resolve, e eu já mostrei esse raciocínio comparando Astra e Fable 5.1: o vencedor muda conforme a tarefa e a fatura.
Se você tem um sistema com agente em produção e quer decidir isso com número em vez de opinião (qual modelo por tipo de tarefa, qual esforço, quanto custa hoje e quanto custaria depois), é exatamente o que eu monto numa sessão de consultoria técnica: a gente abre o seu fluxo, define o conjunto de teste e sai com a medição montada, não com achismo de lançamento.
Perguntas frequentes
O que é o Claude Opus 5.5?
É o modelo da Anthropic lançado em 22 de setembro de 2026 para codificação agêntica de longa duração e trabalho de conhecimento. Na API é o claude-opus-5-5, custa US$ 4 por milhão de tokens de entrada e US$ 20 de saída, tem 1 milhão de tokens de contexto, 128 mil de saída e esforço padrão medium.
Quanto custa o Opus 5.5 e ele é mais barato que o Opus 5?
É mais barato: US$ 4 de entrada e US$ 20 de saída, contra US$ 5 e US$ 25 do Opus 5, uma queda de 20% nos dois. A leitura de cache caiu 60%, de US$ 0,50 para US$ 0,20, e a escrita de US$ 6,25 para US$ 5. O modo rápido custa US$ 8 e US$ 40.
Opus 5.5 ou Fable 5.1: qual usar?
A documentação recomenda começar pelo Opus 5.5 para a maioria das cargas e usar o Fable 5.1 para raciocínio exigente e trabalho agêntico de longo horizonte, ou quando as suas avaliações no Opus 5.5 com esforço mais alto ainda ficarem abaixo do necessário. O Fable custa US$ 10 e US$ 50.
O Opus 5.5 ganha do GPT-6 Astra?
Ganha em sete dos nove benchmarks publicados, incluindo Terminal-Bench 4.0 (66,4% contra 57,9%) e GDPval-AA v2.1 (1846 contra 1542 de Elo). Perde em AutomationBench (40,0% contra 41,4%) e em Terminal-Bench Science 0.1 (58,7% contra 64,6%). São medições da Anthropic, com ressalvas declaradas.
O que é o parâmetro de esforço e qual usar?
É o controle de quanto o modelo pensa, com níveis low, medium, high, xhigh e max. No Opus 5.5 o padrão é medium, e a curva publicada mostra retorno decrescente do xhigh para o max. Comece no padrão e só suba onde a sua medição mostrar ganho.
Preciso mudar o código para migrar do Opus 5?
Basta trocar o identificador do modelo para claude-opus-5-5. O contexto e a saída máxima são os mesmos, e o preço só cai. O ajuste que costuma ser necessário é de prompt, porque o modelo responde de forma mais curta e mais estruturada que o anterior.
Quer mais conteúdo desse?
Receba toda semana o que escrevo sobre stack, IA aplicada e negócios solo. Zero spam, descadastro num clique.