Een API-vergelijking die op 26 september 2026 verscheen, liet Claude Opus 5.5 en Claude Opus 5 dezelfde twee van drie redeneertaken beantwoorden. Beide modellen haalden de logicapuzzel en het spel met stenen; op een opdracht over een beperkte volgorde gaf geen van beide antwoord.
Zo is de API-test uitgevoerd
De vergelijking gebruikte voor beide modellen dezelfde prompts via de Anthropic API. De instelling voor adaptief denken stond op het standaardniveau en elke taak werd één keer per model uitgevoerd. Tokens zijn teksteenheden die een model verwerkt of genereert; de snelheid hieronder gaat over gegenereerde tokens per seconde.
De drie opdrachten waren een logicapuzzel met 22 aanwijzingen, een probleem over de volgorde van taken en een spel waarbij spelers telkens een bepaald aantal stenen wegnemen. Bij het volgordeprobleem moesten aantallen mogelijke volgordes worden berekend voor 6, 8 en 10 taken, onder beperkingen voor de plaatsing en aangrenzende taken.
Resultaten per taak
| Opdracht | Claude Opus 5.5 | Claude Opus 5 |
| Logicapuzzel | 28/28 goed | 28/28 goed |
| Spel met stenen | 3/3 vragen goed | 3/3 vragen goed |
| Volgordeprobleem | Geen antwoord bij de geteste limieten van 48.000 en 128.000 uitvoertokens | Geen antwoord bij de geteste limieten van 48.000 en 128.000 uitvoertokens |
Gemeten snelheid en de claim van Anthropic
Over de gerapporteerde API-aanroepen kwam Claude Opus 5.5 uit op 103,4 gegenereerde tokens per seconde, tegenover 93,1 voor Claude Opus 5. Dat is in deze test ongeveer 11% meer.
Anthropic stelt dat Claude Opus 5.5 bij typische werklasten meer dan 30% sneller uitvoer genereert dan Opus 5. De API-vergelijking mat een andere, beperkte reeks opdrachten; de cijfers beschrijven dus verschillende omstandigheden.
Wat de uitkomst zegt over redeneervermogen
De resultaten gelden voor drie specifieke redeneeropgaven, elk één keer uitgevoerd per model. Ze geven daarmee geen algemene rangorde van het redeneervermogen van Claude Opus 5.5 en Claude Opus 5.