Uma atualização publicada em 8 de outubro atribuiu ao Claude Haiku 5.5 (max) um custo de US$ 0,21 por tarefa no Intelligence Index, com pontuação 43. O valor é uma média ponderada das tarefas desse benchmark, não uma tarifa fixa para qualquer solicitação à API.
O Haiku 5.5 foi lançado pela Anthropic em 7 de outubro. A cobertura anterior do lançamento e das tarifas por faixa traz esse contexto; o novo dado ajuda a separar custo de benchmark e preço por token.
O que o custo por tarefa do benchmark mede
O Intelligence Index agrega os custos de tokens de entrada, leituras e gravações em cache, raciocínio e respostas nas avaliações, com ponderação entre as tarefas. No resultado de esforço máximo, o Haiku 5.5 marcou 43 pontos e ficou em US$ 0,21 por tarefa ponderada.
Esse número descreve o desempenho econômico naquele conjunto de avaliações. Uma solicitação comum pode usar volumes diferentes de entrada, raciocínio e saída — e, portanto, resultar em outra cobrança.
As tarifas da API variam conforme o tamanho do prompt
A Anthropic publica preços separados para tokens de entrada e de saída. A faixa é definida pelo tamanho do prompt: até 100 mil tokens, valem as tarifas menores; acima desse limite, ambas aumentam.
| Tamanho do prompt | Entrada por 1 milhão de tokens | Saída por 1 milhão de tokens |
| Até 100 mil tokens | US$ 0,10 | US$ 0,50 |
| Acima de 100 mil tokens | US$ 0,50 | US$ 2,50 |
Para ter uma referência concreta, 10 mil tokens de entrada e mil de saída custam US$ 0,0015 na faixa menor, sem uso de cache: US$ 0,001 pela entrada e US$ 0,0005 pela saída. Já um prompt com 120 mil tokens de entrada e 2 mil de saída fica em US$ 0,065 na faixa superior: US$ 0,06 pela entrada e US$ 0,005 pela saída.
A Anthropic também lista tarifas específicas para cache: a leitura custa US$ 0,01 por milhão de tokens na faixa menor e US$ 0,05 na maior. A gravação por cinco minutos custa US$ 0,125 e US$ 0,625, respectivamente; por uma hora, US$ 0,20 e US$ 1,00. Na Batch API, voltada ao processamento em lote, a empresa informa desconto de 50% sobre os preços de entrada e saída.
O modelo tem janela de contexto de 1 milhão de tokens, mas a faixa de preço menor termina em prompts de 100 mil tokens. A capacidade de contexto e o limite que define a tarifa são medidas diferentes.
O que a comparação com GPT-6 Luna indica
Na comparação de esforço máximo do Intelligence Index, o GPT-6 Luna alcançou pontuação semelhante com custo estimado em cerca de um terço do atribuído ao Haiku 5.5. É um resultado daquele benchmark, não uma regra para todo tipo de tarefa ou uso da API.
Em uma comparação separada, de esforço alto, os dois modelos marcaram 38 pontos. O Haiku 5.5 gerou cerca de 55 mil tokens de saída por tarefa, ante aproximadamente 50 mil do GPT-6 Luna. São volumes de saída daquela avaliação; eles não definem, por si só, a cobrança de uma tarefa diferente.
O que pode mudar a conta de uma tarefa real
O total da API depende da quantidade de tokens de entrada e saída, da faixa de tamanho do prompt e do uso de cache ou processamento em lote. O esforço também importa: o Haiku 5.5 oferece pensamento adaptativo e um parâmetro de esforço cujo padrão é médio; mais raciocínio pode alterar o consumo de tokens.
A Anthropic informa ainda que o tokenizador do Haiku 5.5 conta cerca de 30% mais tokens para o mesmo texto do que o do Haiku 4.5. Essa diferença diz respeito à contagem de tokens. O custo de uma tarefa depende do uso efetivo e das tarifas aplicáveis, não apenas do preço anunciado por milhão de tokens.