W teście API opublikowanym 28 września 2026 r. Claude Opus 5.5 uzyskał 15 bezbłędnych przebiegów na 15, a GPT-6 Sol — 12 na 15, w trzech zadaniach programistycznych. Sol działał szybciej i kosztował mniej na przebieg w każdym z nich. To wyniki tego konkretnego testu, a nie ogólny ranking modeli.
Trzy powtarzane zadania programistyczne
Każdy model uruchomiono pięć razy na każde zadanie, przy użyciu identycznych promptów i najwyższego dostępnego poziomu wysiłku. W teście ten poziom określono jako „max”.
Pierwszym zadaniem była analiza 40 nieudanych zadań CI i warunkowej instrukcji postępowania. Model miał zdecydować, czy ponowić próbę, zablokować proces, czy powiadomić zespół. Drugie polegało na analizie 3664 wierszy logów z pięciu usług podczas dwugodzinnej awarii oraz odpowiedzi na siedem pytań. W trzecim model miał wdrożyć resolver zależności na podstawie dwustronicowej specyfikacji; rozwiązanie sprawdzał zestaw 120 ukrytych testów.
Wyniki według zadania: skuteczność, czas i koszt
| Zadanie (5 przebiegów na model) | Claude Opus 5.5: bezbłędne przebiegi | GPT-6 Sol: bezbłędne przebiegi | Średni czas na przebieg: Opus 5.5 / Sol | Raportowany koszt na przebieg: Opus 5.5 / Sol |
| Selekcja zadań CI | 5/5 | 5/5 | 1 min 27 s / 18 s | 0,24 USD / 0,02 USD |
| Analiza logów incydentu | 5/5 | 2/5 | 6 min 44 s / 1 min 41 s | 1,68 USD / 0,30 USD |
| Specyfikacja resolvera | 5/5 | 4/5 | 9 min 40 s / 6 min 28 s | 1,42 USD / 0,22 USD |
Co poszło nie tak w przebiegach GPT-6 Sol
W dwóch przebiegach analizy logów GPT-6 Sol pominął tego samego klienta. Pierwotne obciążenie tego klienta potwierdzono 52 sekundy po udanej ponownej próbie. W kolejnym przebiegu Sol policzył 27 nieudanych prób finalizacji zakupu zamiast 28.
Jeden z pięciu przebiegów resolvera zakończył się błędem importu przez zbędny nawias zamykający w wierszu 78. W rezultacie rozwiązanie nie zaliczyło żadnego ze 120 ukrytych testów.
Co te wyniki mówią o pracy programistycznej
W tych trzech zadaniach Claude Opus 5.5 częściej kończył pracę bez błędu, natomiast GPT-6 Sol za każdym razem potrzebował mniej czasu i miał niższy raportowany koszt na przebieg. Dla pracy, w której liczy się zaliczenie całego zestawu testów, różnica w skuteczności ma znaczenie; tam, gdzie ważniejszy jest czas i koszt pojedynczego uruchomienia, wyniki faworyzują Sol. Dotyczy to jednak tylko zadań opisanych w tym teście.
Pojedyncze wywołanie CI to nie AutomationBench
Zadanie CI w tym porównaniu polegało na pojedynczym wywołaniu API. OpenAI opisuje AutomationBench jako test kompleksowych przepływów pracy z użyciem 47 narzędzi, więc te oceny obejmują inny zakres. W osobnym porównaniu premierowym OpenAI zestawiło GPT-6 Sol w ustawieniu xhigh z Claude Opus 5 w ustawieniu max — inną wersją Claude niż Claude Opus 5.5 z testu trzech zadań.