W teście API opublikowanym 28 września 2026 r. Claude Opus 5.5 uzyskał 15 bezbłędnych przebiegów na 15, a GPT-6 Sol — 12 na 15, w trzech zadaniach programistycznych. Sol działał szybciej i kosztował mniej na przebieg w każdym z nich. To wyniki tego konkretnego testu, a nie ogólny ranking modeli.

Trzy powtarzane zadania programistyczne

Każdy model uruchomiono pięć razy na każde zadanie, przy użyciu identycznych promptów i najwyższego dostępnego poziomu wysiłku. W teście ten poziom określono jako „max”.

Pierwszym zadaniem była analiza 40 nieudanych zadań CI i warunkowej instrukcji postępowania. Model miał zdecydować, czy ponowić próbę, zablokować proces, czy powiadomić zespół. Drugie polegało na analizie 3664 wierszy logów z pięciu usług podczas dwugodzinnej awarii oraz odpowiedzi na siedem pytań. W trzecim model miał wdrożyć resolver zależności na podstawie dwustronicowej specyfikacji; rozwiązanie sprawdzał zestaw 120 ukrytych testów.

Wyniki według zadania: skuteczność, czas i koszt

Zadanie (5 przebiegów na model)Claude Opus 5.5: bezbłędne przebiegiGPT-6 Sol: bezbłędne przebiegiŚredni czas na przebieg: Opus 5.5 / SolRaportowany koszt na przebieg: Opus 5.5 / Sol
Selekcja zadań CI5/55/51 min 27 s / 18 s0,24 USD / 0,02 USD
Analiza logów incydentu5/52/56 min 44 s / 1 min 41 s1,68 USD / 0,30 USD
Specyfikacja resolvera5/54/59 min 40 s / 6 min 28 s1,42 USD / 0,22 USD

Co poszło nie tak w przebiegach GPT-6 Sol

W dwóch przebiegach analizy logów GPT-6 Sol pominął tego samego klienta. Pierwotne obciążenie tego klienta potwierdzono 52 sekundy po udanej ponownej próbie. W kolejnym przebiegu Sol policzył 27 nieudanych prób finalizacji zakupu zamiast 28.

Jeden z pięciu przebiegów resolvera zakończył się błędem importu przez zbędny nawias zamykający w wierszu 78. W rezultacie rozwiązanie nie zaliczyło żadnego ze 120 ukrytych testów.

Co te wyniki mówią o pracy programistycznej

W tych trzech zadaniach Claude Opus 5.5 częściej kończył pracę bez błędu, natomiast GPT-6 Sol za każdym razem potrzebował mniej czasu i miał niższy raportowany koszt na przebieg. Dla pracy, w której liczy się zaliczenie całego zestawu testów, różnica w skuteczności ma znaczenie; tam, gdzie ważniejszy jest czas i koszt pojedynczego uruchomienia, wyniki faworyzują Sol. Dotyczy to jednak tylko zadań opisanych w tym teście.

Pojedyncze wywołanie CI to nie AutomationBench

Zadanie CI w tym porównaniu polegało na pojedynczym wywołaniu API. OpenAI opisuje AutomationBench jako test kompleksowych przepływów pracy z użyciem 47 narzędzi, więc te oceny obejmują inny zakres. W osobnym porównaniu premierowym OpenAI zestawiło GPT-6 Sol w ustawieniu xhigh z Claude Opus 5 w ustawieniu max — inną wersją Claude niż Claude Opus 5.5 z testu trzech zadań.