Una comparación por API publicada el 26 de septiembre de 2026 encontró que Claude Opus 5.5 y Claude Opus 5 resolvieron dos de tres problemas de razonamiento; ninguno respondió al tercero. En ese conjunto de pruebas, Opus 5.5 alcanzó una tasa agregada de generación de 103,4 tokens por segundo, frente a 93,1 de Opus 5.

Cómo se hizo la comparación

Los dos modelos recibieron las mismas instrucciones a través de la API de Anthropic. La prueba usó pensamiento adaptativo con el nivel de esfuerzo predeterminado y una ejecución por problema y modelo.

Las tareas abarcaban tres tipos de razonamiento: una cuadrícula lógica para asignar siete ingenieros a días de la semana, lenguajes de programación, servicios y ciudades siguiendo 22 pistas; un problema de ordenamiento restringido; y un juego de retirar piedras. En este último, cada jugador podía retirar 2, 5, 7 u 11 piedras, con restricciones para no repetir su movimiento anterior.

Resultados por tarea

TareaClaude Opus 5.5Claude Opus 5
Cuadrícula lógica28/2828/28
Ordenamiento restringidoSin respuesta en los límites de salida probadosSin respuesta en los límites de salida probados
Juego de piedras3/3 preguntas correctas3/3 preguntas correctas

El problema de ordenamiento pedía calcular las posibilidades para 6, 8 y 10 trabajos. Las reglas impedían asignar un trabajo a su posición fija y colocar juntos trabajos con números consecutivos. Ninguno de los modelos respondió a ese problema en las pruebas realizadas con límites de salida de 48.000 y 128.000 tokens.

La velocidad medida y la afirmación de Anthropic

En las llamadas de la comparación, Opus 5.5 generó 103,4 tokens de salida por segundo y Opus 5, 93,1: una diferencia de alrededor del 11 % en esa prueba. Los tokens de salida son fragmentos de texto generados por el modelo.

Anthropic afirma que Opus 5.5 genera respuestas más de un 30 % rápido que Opus 5 en cargas de trabajo habituales. Esa afirmación de la compañía y la tasa observada en esta comparación describen mediciones de distinto alcance: la prueba examinó tres problemas diseñados para esa comparación, con una ejecución por problema y modelo.