Pular para o conteúdo
Representação visual de conceitos de otimização de custos e desempenho, com gráficos de barras e setas comparando 'Haiku 5.5' com 'Haiku 4.5' e 'Sonnet 5.5', de
Voltar para o Blog

Claude Haiku 5.5: o Preço Real do 75% Mais Barato, o Ajuste de Esforço e Quando Vale Trocar do Haiku 4.5 ou do Sonnet

Equipe Golber.
10 min de leitura
Claude IA

Entre na sua conta para curtir e guardar o que gostou.

Ouça este artigo

Claude Haiku 5.5: o Preço Real do 75% Mais Barato, o Ajuste de Esforço e Quando Vale Trocar do Haiku 4.5 ou do Sonnet

0:00 / 16:02
1×
Sincronia do destaque
no ponto
Se a voz parecer atrás do trecho marcado, atrase o destaque
Representação visual de conceitos de otimização de custos e desempenho, com gráficos de barras e setas comparando 'Haiku 5.5' com 'Haiku 4.5' e 'Sonnet 5.5', de

O Haiku 5.5 corta 90% do preço por token, mas gera 30% mais tokens e tem um degrau de 100 mil. O que é o 75% da manchete, o que cada nível de esforço custa, quando usar no lugar do Sonnet 5.5 e o que quebra ao migrar do Haiku 4.5.

O Claude Haiku 5.5, lançado em 7 de outubro de 2026, é o modelo mais rápido da Anthropic e o primeiro Haiku com ajuste de esforço. A manchete diz que ele custa 75% menos. A conta real é mais interessante, e mais chata: o preço por token caiu 90% para prompts curtos, mas o modelo novo gera cerca de 30% mais tokens para o mesmo texto, e acima de 100 mil tokens o preço sobe cinco vezes.

Abaixo estão o preço comparado ao Haiku 4.5, ao Sonnet 5.5 e aos concorrentes, o que cada nível de esforço muda, em quais tarefas ele é a melhor escolha (e em quais não é) e o que quebra na migração. Todos os números vêm da documentação da Anthropic, e deixo marcado o que é da própria empresa e o que foi medido por terceiros.

  • O que é e onde usar: API, claude.ai, Claude Code e nuvens

  • Preço: 90% de corte por token, 75% na média, e o degrau de 100 mil

  • O ajuste de esforço, do low ao max, e o que ele custa

  • Haiku 5.5 ou Sonnet 5.5: o que cada um faz melhor

  • O que quebra ao migrar do Haiku 4.5

O que é o Haiku 5.5

É o modelo pequeno e rápido da família Claude, feito para tarefas de alto volume em que latência e custo pesam: classificação, extração, roteamento, resumos, consulta a banco de dados e atendimento ao cliente. O ID na API é claude-haiku-5-5, com contexto de 1 milhão de tokens e saída de até 128 mil.

Ele está na API, no Amazon Bedrock, no Google Cloud, no Microsoft Foundry e no Claude Code. No claude.ai, a página do anúncio da Anthropic diz que usuários Free, Pro, Max, Team e Enterprise podem selecioná-lo na web, no iOS e no Android. Na API não existe modelo grátis; contas novas ganham uma pequena quantidade de créditos de teste.

As especificações que importam para quem desenvolve: o conhecimento confiável vai até junho de 2026, ele aceita texto e imagem, o pensamento adaptativo vem ligado por padrão e há uso de computador e de navegador por ferramentas próprias. Esta semana a Anthropic também liberou créditos mensais de API para os planos Max e Team.

O preço e o "75% mais barato"

O preço por token do Haiku 5.5 é 90% menor que o do Haiku 4.5 para prompts de até 100 mil tokens, e 50% menor acima disso. Os 75% da manchete são uma média de carga de trabalho, e a Anthropic não publicou a fórmula. A conta de quanto você economiza de verdade depende do tamanho dos seus prompts.

Os preços por milhão de tokens, da página de preços da Anthropic e da página do Google:

Modelo

Entrada

Saída

Leitura de cache

Haiku 5.5, prompt até 100 mil tokens

US$ 0,10

US$ 0,50

US$ 0,01

Haiku 5.5, prompt acima de 100 mil

US$ 0,50

US$ 2,50

US$ 0,05

Haiku 4.5

US$ 1

US$ 5

US$ 0,10

Sonnet 5.5

US$ 2

US$ 10

US$ 0,10

Opus 5.5

US$ 4

US$ 20

Não consultado

GPT-6 Luna (OpenAI), até o degrau

US$ 0,10

US$ 0,50

Igual ao do Haiku 5.5

Gemini 3.8 Flash (Google), até 31/12

US$ 0,75

US$ 3,75

Não consultado

Três detalhes mudam a conta:

  1. O tokenizador novo: a documentação diz que o mesmo texto gera cerca de 30% mais tokens que no Haiku 4.5. Pela minha conta, para prompts curtos você paga cerca de 13% do que pagava (0,10 vezes 1,3, dividido por 1,00), e não 10%.

  2. O degrau de 100 mil tokens: a requisição inteira passa a custar US$ 0,50 de entrada, cinco vezes mais, assim que o prompt passa de 100 mil tokens, contando cache. Com os 30% a mais de tokens, a economia acima do degrau fica perto de 35%, e não de 50%. Os outros modelos atuais cobram o contexto de 1 milhão ao preço padrão.

  3. O esforço: níveis altos gastam muito mais tokens de saída, e saída é a parte cara. O próximo tópico mostra quanto.

Um ponto a favor para quem usa muito cache: a leitura de cache é de US$ 0,01 por milhão, e o Sonnet 5.5 também teve a dele cortada pela metade, de US$ 0,20 para US$ 0,10. E a Batch API continua com 50% de desconto.

Preço por token não é custo por tarefa. Quem compara só a tabela esquece o tokenizador, o degrau e o esforço.

O ajuste de esforço, do low ao max

O Haiku 5.5 é o primeiro Haiku em que você escolhe quanto o modelo pensa. São cinco níveis, low, medium, high, xhigh e max, e o padrão é medium. Quanto mais alto, mais tokens ele gasta para pensar e responder, e mais lenta e cara fica a tarefa.

A documentação define o esforço como "a behavioral signal, not a strict token budget": ele afeta o texto, as chamadas de ferramenta e o pensamento. Na API, vai no parâmetro output_config.effort:

{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "thinking": { "type": "adaptive" },
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "Classifique este ticket: ..." }]
}

Como usar cada nível, segundo a documentação da Anthropic:

  • low: chat, tarefas curtas com ferramentas e alto volume. Economiza muitos tokens, com alguma perda de capacidade. Em prompts longos de agente, pode pular buscas e parar cedo.

  • medium: o ponto de partida, inclusive para código agêntico.

  • high: trabalho de conhecimento e tarefas longas, com obediência estrita a instruções.

  • xhigh e max: só se os seus testes mostrarem ganho. As respostas e o pensamento ficam muito mais longos.

O custo de cada nível aparece em dois testes de terceiros. No Índice de Inteligência da Artificial Analysis, o Haiku 5.5 marca 29 no low, 34 no medium, 38 no high, 41 no xhigh e 43 no max, e usa cerca de três vezes mais tokens de saída que o GPT-6 Luna no max. E no teste do desenvolvedor Simon Willison, o mesmo desenho custou 0,09 centavo de dólar e 7 segundos no low, contra 3,38 centavos e 5 minutos no max.

Dois cuidados práticos: trocar o esforço entre requisições invalida o cache de prompt, e desligar o pensamento só é possível em high ou abaixo. Dá para ler mais sobre o assunto no post sobre o Opus 5.5 e a migração, que usa o mesmo parâmetro.

Haiku 5.5 ou Sonnet 5.5?

O Haiku 5.5 é a melhor escolha para volume, velocidade e tarefas bem delimitadas: classificar, extrair, rotear, resumir, atender. O Sonnet 5.5 continua melhor para código agêntico complexo, e a própria Anthropic diz isso. No Terminal-Bench 4.0, o Haiku faz 39,2% e o Sonnet 5.5 faz 70,6%.

Os números que a Anthropic divulgou na comparação, todos da própria empresa e não auditados:

Teste

Haiku 5.5

Haiku 4.5

GPT-6 Luna

Sonnet 5.5

Terminal-Bench 4.0 (código no terminal)

39,2%

0,0%

16,4%

70,6%

OSWorld 2.1 (uso de computador)

72,4%

15,7%

48,9%

83,9%

Humanity's Last Exam, sem ferramentas

45,9%

10,2%

Não consta

56,9%

FrontierCode 1.1

46,4%

Não consta

42,4%

52,1%

Leia com duas ressalvas. O Terminal-Bench de 39,2% é no esforço máximo, e no medium fica perto de 20%, segundo a VentureBeat. E a Artificial Analysis mediu 33% nesse teste, achou o acerto de fatos fraco (36%, com 40% de alucinação) e viu um resultado ruim num teste de automação que ela atribui a recusas excessivas antes do lançamento. A tabela da Anthropic não inclui o Gemini Flash.

Na prática, perguntei ao Jev qual modelo usar em três tarefas. Para classificar 50 mil mensagens de atendimento por dia, Haiku, com 100%. Para refatorar um módulo grande rodando testes no terminal, Sonnet 5.5, com 81%, e o Opus 5.5 com 19%. E para um agente de código com um modelo forte planejando e vários subagentes baratos executando, Opus ou Sonnet no planejamento e Haiku 5.5 nos subagentes, com 100%. É o desenho que a Anthropic também recomenda.

O que os clientes citados no anúncio dizem, sempre com a ressalva de que são números das próprias empresas: a Asana fala em mais de 30% de redução de latência, e a Box, em 11 pontos a mais que o Haiku 4.5 com cerca de metade da latência. Para escolher entre assinaturas, veja o post sobre se vale a pena pagar IA, e para o concorrente da OpenAI, o do GPT-6 Luna grátis.

O que quebra ao migrar

A documentação diz que os prompts do Haiku 4.5 devem funcionar sem mudanças, mas o código de chamada precisa de ajustes: o Haiku 5.5 recusa temperatura e top_p diferentes do padrão, não aceita preencher a resposta do assistente e dá erro se você usar budget_tokens. Há também uma nova razão de parada, refusal.

O checklist de migração, pelo guia oficial:

  1. Troque o ID por claude-haiku-5-5, que não tem sufixo de data nem alias.

  2. Recalcule os tokens: o tokenizador é outro.

  3. Use pensamento adaptativo e o parâmetro de esforço, em vez de budget_tokens.

  4. Tire temperature, top_p e top_k com valores fora do padrão.

  5. Remova o preenchimento da resposta do assistente (o chamado prefill), que agora retorna erro 400.

  6. No uso de computador, troque para o novo conjunto de ferramentas.

  7. Trate o stop_reason igual a refusal, que vem de classificadores de segurança, sem alternativa automática no servidor.

Sobre prazos, o Haiku 4.5 segue ativo, com retirada prevista para "não antes de 15 de outubro de 2026" e aviso de pelo menos 60 dias. O Haiku 5.5 tem compromisso até 7 de outubro de 2027. No Claude Code há um atalho: /claude-api migrate this project to claude-haiku-5-5. O ritmo é rápido: o Sonnet 4.5 foi marcado como obsoleto em 30 de setembro, com retirada em 30 de novembro.

Uma observação sobre segurança: as salvaguardas de cibersegurança do Haiku 5.5 são mais restritivas que as do 4.5, e ele pode barrar testes de invasão. Existe um programa de verificação para quem precisa de acesso mais amplo. E vale lembrar do que a Anthropic prometeu em setembro: no post sobre o Fable 5.5 e os boatos, o Haiku 5.5 era o próximo lançamento esperado, e saiu em 7 de outubro.

As apostas, com a probabilidade do Jev, escritas pelo lado que ele acha mais provável. Eu confiro em janeiro, e o resultado vai para o placar público das previsões:

ApostaConfiançaVerificaçãoResultado
Até 31/12/2026, a Anthropic não marca o Claude Haiku 4.5 como obsoleto (deprecado).91%05/01/2027Em aberto
Até 31/12/2026, a Anthropic não muda o preço por token do Claude Haiku 5.5.85%05/01/2027Em aberto
Até 31/12/2026, a Anthropic não lança um Sonnet ou Opus de versão maior que 5.5.82%05/01/2027Em aberto
Até 31/12/2026, a Anthropic não remove o degrau de preço de 100 mil tokens do Haiku 5.5.96%05/01/2027Em aberto

Se você quer ajuda para decidir qual modelo e qual nível de esforço colocar em cada etapa do seu sistema, medindo o custo por tarefa e não por token, é o tipo de conta que eu faço na consultoria técnica.

Perguntas frequentes

Quanto custa o Claude Haiku 5.5?

US$ 0,10 por milhão de tokens de entrada e US$ 0,50 de saída para prompts de até 100 mil tokens. Acima disso, a requisição inteira custa US$ 0,50 e US$ 2,50. A leitura de cache custa US$ 0,01 e a Batch API dá 50% de desconto.

Haiku 5.5 ou Sonnet 5.5?

Haiku para volume, velocidade e tarefas delimitadas, como classificar, extrair, rotear e resumir. Sonnet 5.5 para código agêntico complexo e raciocínio mais pesado. Um Sonnet custa 20 vezes mais na entrada.

O Haiku 5.5 é grátis?

No claude.ai, dentro dos limites de cada plano, inclusive o Free, que pode selecioná-lo na web, no iOS e no Android. Na API ele é pago por token, e contas novas ganham apenas uma pequena quantidade de créditos de teste.

O que é o ajuste de esforço do Haiku 5.5?

Um parâmetro que controla quanto o modelo pensa e gasta, em cinco níveis: low, medium (o padrão), high, xhigh e max. Níveis mais altos entregam mais qualidade, mas ficam mais lentos e consomem muito mais tokens de saída.

O que acontece com o Haiku 4.5?

Segue ativo. A retirada está prevista para não antes de 15 de outubro de 2026, com aviso de pelo menos 60 dias. Quem migrar precisa trocar o ID, recontar tokens e ajustar parâmetros que deixaram de existir.

Gostou?
Compartilhar

Golber Dóriaquem escreve este blog

Receba os posts novos no seu email

IA aplicada ao trabalho, stack e o negócio de uma pessoa só, direto na sua caixa de entrada. Sem spam, e sair é um clique em qualquer email.