El 8 de octubre se difundió una comparación del Intelligence Index que asignó a Claude Haiku 5.5, con el esfuerzo máximo, un coste ponderado de 0,21 dólares por tarea y una puntuación de 43. Esa cifra corresponde a tareas del benchmark: no es una tarifa fija para cualquier solicitud a la API. Anthropic cobra por tokens de entrada y salida, con precios distintos según la longitud del prompt.

Qué mide el coste por tarea del benchmark

El coste del Intelligence Index es un promedio ponderado de las tareas de su evaluación. El cálculo considera los tokens de entrada, los de lectura y escritura en caché, los de razonamiento y los de respuesta. Por eso, los 0,21 dólares describen el resultado de Claude Haiku 5.5 en esa evaluación con esfuerzo máximo, no el coste de un trabajo elegido por un cliente.

La distinción importa: una tarea que genere más tokens puede costar más aunque el precio por token sea bajo. Y el esfuerzo seleccionado también puede cambiar el consumo de tokens.

Las tarifas de Anthropic según la longitud del prompt

Anthropic publica las tarifas de API en dólares estadounidenses por millón de tokens. El tramo depende de la longitud del prompt: hasta 100.000 tokens se aplican unas tarifas; por encima de ese umbral, otras.

CargoPrompt de hasta 100.000 tokens (USD por millón)Prompt de más de 100.000 tokens (USD por millón)
Entrada0,100,50
Salida0,502,50
Lectura de caché0,010,05
Escritura en caché durante 5 minutos0,1250,625
Escritura en caché durante 1 hora0,201,00

Para poner las tarifas de entrada y salida en contexto, una llamada con 10.000 tokens de entrada y 1.000 de salida cuesta 0,0015 dólares si el prompt queda por debajo del umbral y no usa caché: 0,001 dólares por la entrada y 0,0005 por la salida. Con 120.000 tokens de entrada y 2.000 de salida, el coste calculado con las tarifas del tramo superior es 0,065 dólares: 0,06 por la entrada y 0,005 por la salida.

Anthropic también ofrece un descuento del 50 % en los precios de entrada y salida mediante Batch API. El coste de una llamada depende, por tanto, del volumen de entrada y salida, el tramo aplicable, el uso de caché y el tratamiento de la solicitud.

El umbral de 100.000 tokens determina el tramo de precio; la ventana de contexto de Claude Haiku 5.5 es de un millón de tokens. Son límites distintos. La documentación de Anthropic también establece una salida máxima de 128.000 tokens y un esfuerzo medio predeterminado para el razonamiento adaptativo.

El contraste reportado con GPT-6 Luna

En la comparación del Intelligence Index publicada el 8 de octubre, GPT-6 Luna alcanzó una puntuación máxima similar a un coste aproximado de un tercio del de Haiku 5.5. El recuento de salida asociado fue de unos 50.000 tokens por tarea para Luna y 162.000 para Haiku 5.5. Es un resultado ligado a esa evaluación y a ese nivel de esfuerzo.

En otra comparación, con esfuerzo alto y una puntuación de 38, Haiku 5.5 generó unos 55.000 tokens de salida por tarea y GPT-6 Luna unos 50.000. Esa medición aporta recuentos de tokens; no una cifra de coste para cada modelo en ese nivel.

Qué determina el coste real de una llamada

Además de los tokens de entrada y salida, la caché y el esfuerzo influyen en el total. Anthropic ofrece razonamiento adaptativo y un parámetro de esfuerzo; el nivel medio es el predeterminado. Una configuración que produzca más tokens de razonamiento puede aumentar el consumo facturado.

Anthropic señala que su nuevo tokenizador cuenta aproximadamente un 30 % más de tokens para el mismo texto que el tokenizador de Haiku 4.5. Ese dato compara el recuento de tokens para un texto equivalente; el coste de cada llamada sigue dependiendo de los tokens que genere y de las tarifas que se apliquen.

NeoTeo ya explicó el lanzamiento y los tramos de precios en su cobertura anterior de Claude Haiku 5.5.