Un comparatif publié le 28 septembre 2026 rapporte que Claude Opus 5.5 a obtenu 15 exécutions parfaites sur 15, contre 12 sur 15 pour GPT-6 Sol. Sur chacune des trois tâches évaluées, Sol a toutefois été plus rapide et moins coûteux par exécution. Ces résultats portent sur cinq répétitions de chaque tâche et ne classent pas les modèles pour tous les usages.
Les trois tâches de développement répétées
Les deux modèles ont reçu les mêmes consignes pour trois tâches, avec leur réglage d’effort maximal, décrit comme « max ». Chaque tâche a été répétée cinq fois pour chaque modèle.
Le tri des échecs d’intégration continue (CI) portait sur 40 échecs de tâches CI et un runbook conditionnel : le modèle devait décider s’il fallait relancer une tâche, bloquer le processus ou déclencher une alerte. Pour analyser l’incident, il fallait exploiter 3 664 lignes de journaux issues de cinq services pendant une panne de deux heures, puis répondre à sept questions. Enfin, la tâche de résolution de dépendances consistait à implémenter un résolveur à partir d’une spécification de deux pages ; une série de 120 tests cachés servait à évaluer le résultat.
Résultats par tâche : réussites, durée et coût
GPT-6 Sol a affiché un temps moyen et un coût rapporté par exécution inférieurs dans les trois tâches. Claude Opus 5.5 a obtenu davantage d’exécutions parfaites au total.
| Tâche (5 exécutions par modèle) | Claude Opus 5.5 : exécutions parfaites | GPT-6 Sol : exécutions parfaites | Durée moyenne par exécution : Opus 5.5 / Sol | Coût rapporté par exécution : Opus 5.5 / Sol (dollars US) |
| Tri des échecs CI | 5/5 | 5/5 | 1 min 27 s / 18 s | 0,24 / 0,02 |
| Analyse des journaux d’incident | 5/5 | 2/5 | 6 min 44 s / 1 min 41 s | 1,68 / 0,30 |
| Résolveur de dépendances | 5/5 | 4/5 | 9 min 40 s / 6 min 28 s | 1,42 / 0,22 |
Les erreurs rapportées de GPT-6 Sol
Dans l’analyse des journaux d’incident, deux exécutions de Sol ont omis le même client, dont le paiement initial avait été confirmé 52 secondes après la réussite d’une nouvelle tentative. Lors d’une autre exécution, le modèle a compté 27 paiements échoués au lieu de 28.
Sur le résolveur, une parenthèse fermante supplémentaire à la ligne 78 a provoqué une erreur d’importation. L’exécution concernée a échoué aux 120 tests cachés. Dans une tâche évaluée par une suite de tests, une petite faute de syntaxe peut donc faire échouer l’ensemble du résultat.
Ce que ces résultats indiquent pour le développement
Dans ce jeu d’essai, Claude Opus 5.5 a fourni le résultat parfait le plus souvent, tandis que GPT-6 Sol a demandé moins de temps et coûté moins cher à chaque exécution. Pour des tâches proches de celles-ci, le choix dépend donc du critère prioritaire : le nombre de résultats parfaits observés ou le temps et le coût par passage. Les chiffres ne tranchent pas la question pour d’autres types de travail.
Un appel CI ne correspond pas à AutomationBench
Le test de tri CI reposait sur un seul appel. OpenAI décrit AutomationBench comme un flux de travail de bout en bout faisant intervenir 47 outils : les deux évaluations ne portent donc pas sur le même type de tâche.
Les comparaisons présentées au lancement par OpenAI portaient par ailleurs sur GPT-6 Sol avec le réglage « xhigh » et Claude Opus 5 avec le réglage « max ». Elles ne testaient pas le même duo de modèles que ce comparatif, qui confrontait GPT-6 Sol à Claude Opus 5.5.