Em um teste por API publicado em 26 de setembro de 2026, Claude Opus 5.5 e Claude Opus 5 tiveram os mesmos resultados em três problemas: ambos resolveram uma grade lógica e um jogo de pedras, mas nenhum respondeu a um problema de ordenação com restrições.
Como o teste por API foi conduzido
Os dois modelos receberam prompts idênticos pela API da Anthropic, com pensamento adaptativo no nível de esforço padrão. O teste teve uma execução por problema para cada modelo.
Tokens são unidades de texto processadas pelo modelo. A taxa de geração de tokens de saída indica quantas dessas unidades ele produziu por segundo.
Resultados nas três tarefas
| Tarefa | Claude Opus 5.5 | Claude Opus 5 |
| Grade lógica | 28/28 | 28/28 |
| Ordenação com restrições, nos limites de 48 mil e 128 mil tokens | Não respondeu | Não respondeu |
| Jogo de pedras | 3/3 respostas corretas | 3/3 respostas corretas |
Velocidade medida e afirmação da Anthropic
A taxa agregada de geração foi de 103,4 tokens de saída por segundo com Claude Opus 5.5 e 93,1 com Claude Opus 5: cerca de 11% a mais para Opus 5.5 nessa avaliação.
Em 22 de setembro de 2026, a Anthropic afirmou que Opus 5.5 gera saídas mais de 30% rápido que Opus 5. A afirmação da empresa sobre velocidade e a taxa medida nessa avaliação dizem respeito a escopos distintos.
Os resultados se limitam aos três problemas, às configurações descritas e a uma execução por problema e modelo; eles não estabelecem um resultado geral sobre a capacidade de raciocínio dos dois modelos.