Ein am 28. September 2026 veröffentlichter Bericht über einen API-Vergleich meldete für Claude Opus 5.5 15 fehlerfreie Durchläufe von 15, für GPT-6 Sol 12 von 15. Getestet wurden drei Entwickleraufgaben mit jeweils fünf Wiederholungen pro Modell. Sol war in allen drei Aufgaben schneller und kostete pro Durchlauf weniger.
Claude Opus 5.5 erzielte 15 von 15 fehlerfreien Durchläufen, GPT-6 Sol 12
Beide Modelle liefen mit denselben Prompts und jeweils der höchsten verfügbaren Aufwandsstufe, die im Vergleich als „max“ bezeichnet wurde. Die Ergebnisse beziehen sich auf diese drei Aufgaben und ihre jeweiligen Testbedingungen.
Drei Entwickleraufgaben im Wiederholungstest
Bei der CI-Triage sollte das Modell 40 fehlgeschlagene CI-Jobs anhand eines bedingten Runbooks bewerten und entscheiden, ob ein erneuter Versuch, eine Blockierung oder eine Benachrichtigung nötig war. Beide Modelle erzielten in allen fünf Durchläufen ein fehlerfreies Ergebnis.
Für die Analyse von Störungsprotokollen dienten 3.664 Zeilen aus fünf Diensten während eines zweistündigen Ausfalls. Dazu gehörten sieben Fragen. Beim dritten Test sollte jedes Modell anhand einer zweiseitigen Spezifikation einen Abhängigkeitsresolver implementieren; bewertet wurde der Code mit 120 verborgenen Tests.
Ergebnisse je Aufgabe: Durchläufe, Zeit und Kosten
Die Tabelle zeigt die Zahl fehlerfreier Durchläufe sowie die durchschnittliche Zeit und die berichteten Kosten pro Durchlauf. Bei Zeit und Kosten stehen die Werte für Claude Opus 5.5 jeweils vor denen für GPT-6 Sol.
| Aufgabe (je 5 Durchläufe pro Modell) | Claude Opus 5.5: fehlerfrei | GPT-6 Sol: fehlerfrei | Durchschnittliche Zeit pro Durchlauf (Opus 5.5 / Sol) | Kosten pro Durchlauf in US-Dollar (Opus 5.5 / Sol) |
| CI-Triage | 5/5 | 5/5 | 1 min 27 s / 18 s | 0,24 / 0,02 |
| Störungsprotokolle | 5/5 | 2/5 | 6 min 44 s / 1 min 41 s | 1,68 / 0,30 |
| Abhängigkeitsresolver | 5/5 | 4/5 | 9 min 40 s / 6 min 28 s | 1,42 / 0,22 |
Wo GPT-6 Sol Fehler machte
Bei der Protokollanalyse übersah GPT-6 Sol in zwei Durchläufen denselben Kunden, dessen ursprüngliche Belastung 52 Sekunden nach einem erfolgreichen Wiederholungsversuch bestätigt worden war. In einem weiteren Durchlauf zählte das Modell 27 fehlgeschlagene Checkout-Vorgänge statt 28.
Beim Abhängigkeitsresolver verursachte eine überzählige schließende Klammer in Zeile 78 einen Importfehler. In diesem Durchlauf scheiterte der Code an allen 120 verborgenen Tests.
Was die Ergebnisse für Entwicklungsaufgaben bedeuten
Bei der CI-Triage waren beide Modelle in allen fünf Durchläufen fehlerfrei; GPT-6 Sol benötigte im Mittel 18 Sekunden und kostete 0,02 US-Dollar pro Durchlauf. Bei der Analyse der Störungsprotokolle und beim Resolver erzielte Claude Opus 5.5 mehr fehlerfreie Ergebnisse, während GPT-6 Sol in beiden Aufgaben weniger Zeit und Geld pro Durchlauf benötigte. Das macht den Unterschied zwischen Tempo und zuverlässigen Ergebnissen in genau diesen Tests greifbar.
Der CI-Einzelaufruf ist nicht AutomationBench
Die CI-Triage bestand aus einem einzelnen API-Aufruf. OpenAI beschreibt AutomationBench dagegen als End-to-End-Workflow mit 47 Tools. Auch ein von OpenAI veröffentlichter Vergleich betrifft eine andere Modellpaarung: GPT-6 Sol lief dort mit „xhigh“ gegen Claude Opus 5 mit „max“.