Une comparaison par API publiée le 26 septembre 2026 rapporte que Claude Opus 5.5 et Claude Opus 5 ont obtenu les mêmes résultats sur trois problèmes : les deux modèles ont réussi la grille logique et le jeu de retrait de pierres, mais aucun n’a répondu au problème d’ordonnancement contraint. Le débit de génération mesuré était d’environ 11 % plus élevé pour Opus 5.5 dans ce test.

Deux tâches réussies, une sans réponse

Les deux modèles ont obtenu 28/28 à une grille logique et répondu correctement aux trois questions d’un jeu de retrait de pierres. En revanche, aucun n’a fourni de réponse au problème d’ordonnancement, même lorsque la limite de sortie était fixée à 48 000 ou à 128 000 jetons.

Comment la comparaison par API a été menée

Les essais ont utilisé l’API d’Anthropic, avec les mêmes consignes pour les deux modèles, la réflexion adaptative au niveau d’effort par défaut et un seul essai par problème et par modèle. Un jeton est une unité de texte traitée ou générée par le modèle; les jetons de sortie correspondent ici au texte produit.

La grille logique demandait d’associer sept ingénieurs à des jours, des langages de programmation, des services et des villes à partir de 22 indices. Le problème d’ordonnancement imposait des contraintes sur la position des tâches et leur ordre. Le jeu de pierres autorisait des retraits de 2, 5, 7 ou 11 pierres, avec des règles empêchant les joueurs de répéter certains coups.

Résultats des trois tâches

TâcheClaude Opus 5.5Claude Opus 5
Grille logique28/2828/28
Ordonnancement contraintAucune réponse, aux limites de 48 000 et 128 000 jetonsAucune réponse, aux limites de 48 000 et 128 000 jetons
Jeu de retrait de pierres3/3 réponses correctes3/3 réponses correctes

Débit mesuré et affirmation d’Anthropic

Dans cette comparaison, le débit agrégé de génération était de 103,4 jetons de sortie par seconde pour Claude Opus 5.5, contre 93,1 pour Claude Opus 5, soit environ 11 % de plus. Anthropic affirme de son côté qu’Opus 5.5 génère ses réponses plus de 30 % plus vite qu’Opus 5. Cette affirmation de l’entreprise et la mesure issue des trois problèmes portent sur des périmètres distincts.

Chaque problème n’a été exécuté qu’une fois par modèle; ces résultats décrivent donc les trois tâches et les réglages utilisés dans cette comparaison.