Claude Haiku 5.5 custa 90% menos abaixo de 100.000 tokens. Essa linha agora é uma decisão de arquitetura
O Haiku 5.5 da Anthropic barateia etapas de agente de alto volume, mas só enquanto a requisição fica abaixo de 100.000 tokens. Roteamento, compactação e cache agora decidem a maior parte da conta.
Ouça este artigo · 5 min
Narração completa do artigo, gerada por IA.

Dez centavos. É o que a Anthropic agora cobra por um milhão de tokens de entrada enviados ao Claude Haiku 5.5, lançado em 7 de outubro, desde que a requisição fique em ou abaixo de 100.000 tokens. Ultrapasse essa linha e o mesmo token custa cinco vezes mais.
Os dois números importam. O primeiro muda qual modelo um agente deve chamar por padrão. O segundo transforma o tamanho de cada requisição em algo que um arquiteto precisa projetar, não apenas observar.
| US$ por milhão de tokens | Entrada | Saída | Leitura de cache |
|---|---|---|---|
| Haiku 5.5, até 100K tokens | 0,10 | 0,50 | 0,01 |
| Haiku 5.5, acima de 100K tokens | 0,50 | 2,50 | 0,05 |
| Haiku 4.5 | 1,00 | 5,00 | 0,10 |
| Sonnet 5.5 | 2,00 | 10,00 | 0,10 |
A chamada barata deixa de ser um compromisso
O Haiku 4.5 custava US$ 1 por milhão de tokens de entrada e US$ 5 por milhão de saída. O Haiku 5.5 custa um décimo disso abaixo da linha, e a Anthropic o descreve como cerca de 75% mais barato de rodar no geral, uma estimativa combinada que mistura as duas faixas de preço. O ID do modelo é claude-haiku-5-5, e ele está disponível na própria plataforma da Anthropic, na AWS, no Google Cloud e no Microsoft Azure. A Databricks o adicionou ao Unity Gateway no mesmo dia.
A Anthropic o aponta exatamente para as etapas que compõem a maior parte do tráfego de um agente: classificação, sumarização, compactação de contexto, consultas a banco de dados, subagentes, suporte ao vivo e trabalho repetitivo de navegador. Seus números de benchmark são da própria Anthropic, e devem ser tratados como um motivo para testar, não como um resultado.
Já argumentamos que um agente não deve perguntar a um modelo de fronteira a cada pequena questão. Com o Sonnet 5.5 a vinte vezes o preço de entrada do Haiku 5.5 abaixo da linha, esse argumento deixa de ser uma otimização e se torna o padrão. O ponto de partida sensato para um novo agente agora é o inverso do usual: cada etapa começa no modelo pequeno, e uma etapa só é promovida a um modelo maior quando a avaliação mostra que o pequeno está falhando nela.
Uma linha de preço dentro da janela de contexto
O limiar de 100.000 tokens é onde o design entra. Acima dele, o Haiku 5.5 ainda custa 50% do preço do Haiku 4.5, mas cada token custa cinco vezes o que custava um momento antes.
Os agentes cruzam essa linha de maneiras previsíveis. Um orquestrador passa todo o histórico da conversa para cada subagente. Uma etapa de recuperação retorna vinte documentos quando três bastariam. Uma tarefa de longa duração acumula saídas de ferramentas que ninguém remove. Cada hábito era tolerável quando toda requisição custava aproximadamente o mesmo. Agora cada um tem um preço.
Dois padrões de design se seguem.
A compactação se torna um controle de custo. Um modelo barato resumindo o estado para que a próxima chamada fique abaixo da linha é exatamente o trabalho que a Anthropic anuncia para o Haiku 5.5. O risco é que um resumo perca o detalhe que uma etapa posterior precisava, então a medida é o sucesso da tarefa após a compactação, não os tokens economizados.
Prefixos estáveis se tornam quase gratuitos. As leituras de cache custam US$ 0,01 por milhão de tokens abaixo da linha. Prompts de sistema, definições de ferramentas e texto de política que se repetem a cada chamada devem ficar no início da requisição, inalterados, para que sejam lidos do cache. A mesma lógica agora se aplica ao Sonnet 5.5, cujas leituras de cache foram reduzidas em 50%.
Onde os 90% não aparecem
Um preço por token não é um custo por resultado. Se o modelo barato precisa de uma nova tentativa em uma a cada cinco chamadas, ou escala um terço de seus casos para um modelo maior, a economia encolhe rápido. É por isso que custo por saída aceita, não por chamada, é o número a gerenciar em um portfólio de modelos.
O Haiku 5.5 também vem com uma configuração de esforço de Low a Max. Mais esforço geralmente significa mais tokens de saída, e em cada linha da tabela acima um token de saída custa cinco vezes um token de entrada. O esforço é um botão a ser ajustado por etapa, não uma vez por agente.
Por fim, o caminho importa tanto quanto o preço. No Amazon Bedrock, o modelo é oferecido por meio de perfis de inferência geográficos para os EUA, a UE, a Austrália e o Japão, além de um perfil global. Não há perfil para a América do Sul. Uma empresa brasileira que chama o Haiku 5.5 no Bedrock usaria o perfil global, então o processamento pode acontecer fora do Brasil: uma transferência internacional de dados pessoais sob a LGPD, regida pela regulamentação da ANPD sobre transferências internacionais (Resolução CD/ANPD nº 19/2024).
O número manchete é 90%. O número útil é outro: a parcela das chamadas do seu agente que realmente precisa de algo maior do que o modelo mais barato em que você confia. A maioria dos times nunca mediu isso, e a Anthropic acaba de tornar essa medição válida.