Een externe API-vergelijking rapporteerde 15 volledig geslaagde runs voor Claude Opus 5.5 en 12 voor GPT-6 Sol, verdeeld over drie ontwikkeltaken. GPT-6 Sol was in elke taak gemiddeld sneller en goedkoper per run. De vergelijking verscheen op 28 september 2026.
De drie herhaalde ontwikkeltaken
Elk model kreeg voor iedere taak vijf keer dezelfde prompt. De test gebruikte voor beide modellen hun hoogste inspanningsniveau, aangeduid als max.
- CI-triage: 40 mislukte CI-jobs beoordelen en bepalen of een job opnieuw moest draaien, geblokkeerd moest worden of een team moest waarschuwen.
- Analyse van storingslogs: 3.664 regels van vijf diensten onderzoeken rond een storing van twee uur en zeven vragen beantwoorden.
- Een afhankelijkheidsresolver bouwen: een specificatie van twee pagina’s uitvoeren. Een verborgen testreeks van 120 tests beoordeelde de implementatie.
Resultaten per taak
De tabel toont het aantal volledig geslaagde runs, de gemiddelde tijd en de gerapporteerde kosten per run. Elke taak werd vijf keer per model uitgevoerd.
| Taak | Claude Opus 5.5: geslaagde runs | Opus 5.5: gemiddelde tijd per run | Opus 5.5: kosten per run | GPT-6 Sol: geslaagde runs | Sol: gemiddelde tijd per run | Sol: kosten per run |
| CI-triage | 5/5 | 1 min 27 s | $0,24 | 5/5 | 18 s | $0,02 |
| Storingslogs | 5/5 | 6 min 44 s | $1,68 | 2/5 | 1 min 41 s | $0,30 |
| Afhankelijkheidsresolver | 5/5 | 9 min 40 s | $1,42 | 4/5 | 6 min 28 s | $0,22 |
Beide modellen slaagden dus in alle vijf CI-runs. Bij de analyse van storingslogs en de resolver behaalde Claude Opus 5.5 meer volledig geslaagde runs; GPT-6 Sol deed elke taak in kortere tijd en tegen lagere gerapporteerde kosten per run.
Wat ging er mis bij GPT-6 Sol?
Bij de storingslogs miste GPT-6 Sol in twee runs dezelfde klant. De oorspronkelijke afschrijving werd 52 seconden nadat een retry was geslaagd alsnog bevestigd. In een andere run telde het model 27 mislukte afrekenpogingen in plaats van 28.
Bij één uitvoering van de resolver bleef op regel 78 een sluitend haakje staan. Daardoor crashte de import en faalden alle 120 verborgen tests. Dat is een klein codefoutje met een groot gevolg: de run slaagde niet.
Een CI-aanroep is geen AutomationBench
De CI-taak in de vergelijking was één API-aanroep. AutomationBench is een end-to-end-workflowtest met 47 tools, zoals OpenAI die beschrijft. Het zijn dus verschillende soorten evaluaties. Ook OpenAI’s launchvergelijking gebruikte een andere modelcombinatie: GPT-6 Sol op xhigh tegenover Claude Opus 5 op max, niet Claude Opus 5.5.