Una comparación por API publicada el 26 de septiembre de 2026 encontró que Claude Opus 5.5 y Claude Opus 5 resolvieron dos de tres problemas de razonamiento; ninguno respondió al tercero. En ese conjunto de pruebas, Opus 5.5 alcanzó una tasa agregada de generación de 103,4 tokens por segundo, frente a 93,1 de Opus 5.
Cómo se hizo la comparación
Los dos modelos recibieron las mismas instrucciones a través de la API de Anthropic. La prueba usó pensamiento adaptativo con el nivel de esfuerzo predeterminado y una ejecución por problema y modelo.
Las tareas abarcaban tres tipos de razonamiento: una cuadrícula lógica para asignar siete ingenieros a días de la semana, lenguajes de programación, servicios y ciudades siguiendo 22 pistas; un problema de ordenamiento restringido; y un juego de retirar piedras. En este último, cada jugador podía retirar 2, 5, 7 u 11 piedras, con restricciones para no repetir su movimiento anterior.
Resultados por tarea
| Tarea | Claude Opus 5.5 | Claude Opus 5 |
| Cuadrícula lógica | 28/28 | 28/28 |
| Ordenamiento restringido | Sin respuesta en los límites de salida probados | Sin respuesta en los límites de salida probados |
| Juego de piedras | 3/3 preguntas correctas | 3/3 preguntas correctas |
El problema de ordenamiento pedía calcular las posibilidades para 6, 8 y 10 trabajos. Las reglas impedían asignar un trabajo a su posición fija y colocar juntos trabajos con números consecutivos. Ninguno de los modelos respondió a ese problema en las pruebas realizadas con límites de salida de 48.000 y 128.000 tokens.
La velocidad medida y la afirmación de Anthropic
En las llamadas de la comparación, Opus 5.5 generó 103,4 tokens de salida por segundo y Opus 5, 93,1: una diferencia de alrededor del 11 % en esa prueba. Los tokens de salida son fragmentos de texto generados por el modelo.
Anthropic afirma que Opus 5.5 genera respuestas más de un 30 % rápido que Opus 5 en cargas de trabajo habituales. Esa afirmación de la compañía y la tasa observada en esta comparación describen mediciones de distinto alcance: la prueba examinó tres problemas diseñados para esa comparación, con una ejecución por problema y modelo.