Em um teste por API publicado em 26 de setembro de 2026, Claude Opus 5.5 e Claude Opus 5 tiveram os mesmos resultados em três problemas: ambos resolveram uma grade lógica e um jogo de pedras, mas nenhum respondeu a um problema de ordenação com restrições.

Como o teste por API foi conduzido

Os dois modelos receberam prompts idênticos pela API da Anthropic, com pensamento adaptativo no nível de esforço padrão. O teste teve uma execução por problema para cada modelo.

Tokens são unidades de texto processadas pelo modelo. A taxa de geração de tokens de saída indica quantas dessas unidades ele produziu por segundo.

Resultados nas três tarefas

TarefaClaude Opus 5.5Claude Opus 5
Grade lógica28/2828/28
Ordenação com restrições, nos limites de 48 mil e 128 mil tokensNão respondeuNão respondeu
Jogo de pedras3/3 respostas corretas3/3 respostas corretas

Velocidade medida e afirmação da Anthropic

A taxa agregada de geração foi de 103,4 tokens de saída por segundo com Claude Opus 5.5 e 93,1 com Claude Opus 5: cerca de 11% a mais para Opus 5.5 nessa avaliação.

Em 22 de setembro de 2026, a Anthropic afirmou que Opus 5.5 gera saídas mais de 30% rápido que Opus 5. A afirmação da empresa sobre velocidade e a taxa medida nessa avaliação dizem respeito a escopos distintos.

Os resultados se limitam aos três problemas, às configurações descritas e a uma execução por problema e modelo; eles não estabelecem um resultado geral sobre a capacidade de raciocínio dos dois modelos.