Resumen

  • Haiku 5.5 admite hasta un millón de tokens de contexto, pero el precio por token se multiplica por cinco cuando el prompt supera los 100.000.
  • El mismo texto puede consumir cerca de un 30% más de tokens que con Haiku 4.5; por eso, cada cliente necesita volver a medir su tráfico antes de aplicar el ahorro medio anunciado por Anthropic.

Análisis

La capacidad de contexto y el coste de usarla no son equivalentes. Anthropic presentó Haiku 5.5 el 7 de octubre con una ventana de un millón de tokens y una salida de hasta 128.000. Sin embargo, la tabla de precios cambia en 100.000: para prompts de hasta ese tamaño, la entrada cuesta 0,10 dólares por millón de tokens y la salida 0,50. Por encima, los precios suben a 0,50 y 2,50 dólares. La tarifa por token de ambos componentes es cinco veces mayor en esa banda, según los precios de Claude Platform.

No hay incoherencia entre admitir un contexto largo y cobrarlo de otra manera. La primera cifra indica cuánto puede procesar una solicitud; la segunda configura el coste de las solicitudes extensas. Para un comprador, mirar únicamente el precio base de entrada oculta una parte importante de la economía del producto.

La comparación con Haiku 4.5 requiere otra corrección. Anthropic explica que su nuevo tokenizador genera aproximadamente un 30% más de tokens para el mismo texto, aunque el aumento depende del contenido. Su guía de migración recomienda volver a contar los prompts y revisar los presupuestos, en lugar de reutilizar métricas antiguas.

Considérese un texto que antes representaba 50.000 tokens de entrada. Si ahora se acerca a 65.000, el coste de entrada sería de unos 0,05 dólares con Haiku 4.5 y 0,0065 con Haiku 5.5: cerca de un 87% menos a precios de lista. Con un texto que pasara de 80.000 a unos 104.000 tokens, Haiku 5.5 entraría en la banda superior. El cálculo sería 0,08 dólares con Haiku 4.5 y aproximadamente 0,052 con Haiku 5.5, alrededor de un 35% menos. Son ejercicios de entrada solamente: excluyen salida, herramientas, caché, descuentos y diferencias de desempeño. El 30% es una aproximación, no una regla para cada prompt.

Anthropic afirma que Haiku 5.5 cuesta en promedio alrededor de un 75% menos. La nota de lanzamiento dice que el cálculo incorpora el cambio de tokenizador y que el 90% de las solicitudes dirigidas al modelo Haiku anterior tenía 100.000 tokens o menos. Esa cifra describe una mezcla medida por la empresa, no la de todos los clientes. Una cuota de solicitudes no equivale a una cuota del gasto en tokens: unas pocas entradas muy largas pueden representar una parte importante del volumen.

También cuentan el uso de caché y el procesamiento por lotes. Las escrituras y lecturas de caché tienen precios propios, y la API Batch ofrece un descuento del 50% en tokens de entrada y salida. Una solicitud puede incluir historial, definiciones y resultados de herramientas, documentos, tokens de razonamiento y la respuesta. La documentación de ventanas de contexto explica que esos elementos consumen el contexto. El tamaño del documento original, por sí solo, no sirve como presupuesto fiable.

La decisión útil empieza por reconstruir el tráfico real con el tokenizador nuevo y separarlo en bandas por debajo, cerca y por encima de 100.000. Conviene distinguir entrada y salida, medir el cache y marcar qué tareas pueden ir por Batch. Si el grupo de prompts largos domina el gasto, se puede probar recuperación selectiva o síntesis de contexto, pero midiendo si la información retirada deteriora la respuesta.

Por eso, el millón de tokens no es una tarifa ni una promesa de economía. Es capacidad. La cuenta final depende de cuánto contexto produzcan las aplicaciones, de dónde caiga frente al umbral y de qué mecanismos de precio use cada flujo de trabajo.

Fuentes