Claude Haiku 5.5 cuesta 90% menos bajo 100.000 tokens. Esa línea ahora es una decisión de arquitectura
El Haiku 5.5 de Anthropic abarata los pasos de agente de alto volumen, pero solo si la solicitud se mantiene bajo 100.000 tokens. Enrutamiento, compactación y caché deciden la factura.
Escuche este artículo · 6 min
Narración completa del artículo, generada con IA.

Diez centavos. Eso es lo que Anthropic ahora cobra por un millón de tokens de entrada enviados a Claude Haiku 5.5, lanzado el 7 de octubre, siempre que la solicitud se mantenga en o por debajo de 100.000 tokens. Cruce esa línea y el mismo token cuesta cinco veces más.
Ambos números importan. El primero cambia qué modelo debe llamar un agente por defecto. El segundo convierte el tamaño de cada solicitud en algo que un arquitecto tiene que diseñar, no solo observar.
| US$ por millón de tokens | Entrada | Salida | Lectura de caché |
|---|---|---|---|
| Haiku 5.5, hasta 100K tokens | 0,10 | 0,50 | 0,01 |
| Haiku 5.5, más de 100K tokens | 0,50 | 2,50 | 0,05 |
| Haiku 4.5 | 1,00 | 5,00 | 0,10 |
| Sonnet 5.5 | 2,00 | 10,00 | 0,10 |
La llamada barata deja de ser un compromiso
Haiku 4.5 costaba US$ 1 por millón de tokens de entrada y US$ 5 por millón de salida. Haiku 5.5 cuesta una décima parte de eso por debajo de la línea, y Anthropic lo describe como aproximadamente un 75% más barato de ejecutar en general, una estimación mixta que combina ambos niveles de precio. El ID del modelo es claude-haiku-5-5, y está disponible en la plataforma propia de Anthropic, AWS, Google Cloud y Microsoft Azure. Databricks lo añadió a Unity Gateway el mismo día.
Anthropic lo señala exactamente para los pasos que componen la mayor parte del tráfico de un agente: clasificación, resumen, compactación de contexto, consultas a bases de datos, subagentes, soporte en vivo y trabajo repetitivo en el navegador. Sus cifras de benchmark son de Anthropic, y deben tratarse como una razón para probar, no como un resultado.
Hemos argumentado que un agente no debería preguntar a un modelo frontera cada pregunta pequeña. Con Sonnet 5.5 a veinte veces el precio de entrada de Haiku 5.5 por debajo de la línea, ese argumento deja de ser una optimización y se convierte en el valor por defecto. El punto de partida sensato para un nuevo agente ahora es el inverso del habitual: cada paso comienza en el modelo pequeño, y un paso se promueve a un modelo más grande solo cuando la evaluación muestra que el pequeño falla en él.
Una línea de precio dentro de la ventana de contexto
El umbral de 100.000 tokens es donde entra el diseño. Por encima, Haiku 5.5 sigue siendo un 50% más barato que Haiku 4.5, pero cada token cuesta cinco veces lo que costaba un momento antes.
Los agentes cruzan esa línea de formas predecibles. Un orquestador pasa todo el historial de conversación a cada subagente. Un paso de recuperación devuelve veinte documentos cuando tres serían suficientes. Una tarea de larga duración acumula salidas de herramientas que nadie elimina. Cada hábito era tolerable cuando cada solicitud costaba aproximadamente lo mismo. Ahora cada uno tiene un precio.
Dos patrones de diseño se derivan de esto.
La compactación se convierte en un control de costos. Un modelo barato que resume el estado para que la siguiente llamada se mantenga por debajo de la línea es exactamente el trabajo que Anthropic anuncia para Haiku 5.5. El riesgo es que un resumen pierda el único detalle que un paso posterior necesitaba, por lo que la medida es el éxito de la tarea después de la compactación, no los tokens ahorrados.
Los prefijos estables se vuelven casi gratuitos. Las lecturas de caché cuestan US$ 0,01 por millón de tokens por debajo de la línea. Los prompts de sistema, las definiciones de herramientas y el texto de políticas que se repiten en cada llamada deben situarse al inicio de la solicitud, sin cambios, para que se lean desde el caché. La misma lógica se aplica ahora a Sonnet 5.5, cuyas lecturas de caché se redujeron en un 50%.
Donde el 90% no aparece
Un precio por token no es un costo por resultado. Si el modelo barato necesita un reintento en una de cada cinco llamadas, o escala un tercio de sus casos a un modelo más grande, el ahorro se reduce rápidamente. Por eso el costo por salida aceptada, no por llamada, es el número a gestionar en una cartera de modelos.
Haiku 5.5 también incluye un ajuste de esfuerzo de Low a Max. Más esfuerzo generalmente significa más tokens de salida, y en cada fila de la tabla anterior un token de salida cuesta cinco veces un token de entrada. El esfuerzo es un dial que se ajusta por paso, no una vez por agente.
Por último, la ruta importa tanto como el precio. En Amazon Bedrock el modelo se ofrece a través de perfiles de inferencia geográficos para EE. UU., la UE, Australia y Japón, más un perfil global. Una empresa en España con compromisos contractuales sobre dónde ocurre el procesamiento debería elegir el perfil de la UE deliberadamente en lugar de heredar el perfil global por defecto de un ejemplo de código, porque existe un perfil de inferencia geográfico de la UE y eso importa bajo el RGPD. Las empresas en Latinoamérica (México, Colombia, Chile, Argentina) no tienen un perfil regional y usarían el global.
El número titular es 90%. El número útil es otro: la proporción de llamadas de su agente que realmente necesitan algo más grande que el modelo más barato en el que confía. La mayoría de los equipos nunca lo han medido, y Anthropic acaba de hacer que valga la pena medirlo.