Un confronto API pubblicato il 28 settembre 2026 ha riportato 15 esecuzioni perfette su 15 per Claude Opus 5.5 e 12 su 15 per GPT-6 Sol, in tre attività di sviluppo ripetute cinque volte ciascuna. Sol è stato più rapido e meno costoso per esecuzione in tutte e tre le prove; Opus 5.5 ha ottenuto più risultati perfetti nel complesso. I test hanno usato prompt identici e, per ciascun modello, il livello massimo di effort, indicato come «max» nel confronto.
Claude Opus 5.5: 15 esecuzioni perfette su 15; GPT-6 Sol: 12 su 15
Il risultato riguarda il triage dei job CI, l’analisi dei log di un’interruzione di servizio e l’implementazione di un risolutore di dipendenze. Per «esecuzione perfetta» si intende una prova che ha soddisfatto i criteri previsti per quell’attività. Le cifre descrivono questi tre compiti e le relative ripetizioni.
Le tre attività di sviluppo ripetute
Nel triage CI, i modelli dovevano esaminare 40 job falliti e un runbook condizionale, decidendo se riprovare, bloccare o inviare una segnalazione. Entrambi hanno superato tutte e cinque le esecuzioni.
Per l’analisi dell’interruzione, ogni prova comprendeva 3.664 righe di log provenienti da cinque servizi durante un disservizio durato due ore, oltre a sette domande. Nel compito sul risolutore, invece, i modelli dovevano implementare una specifica di due pagine; una suite nascosta di 120 test valutava il risultato.
Risultati per attività: esecuzioni perfette, tempo e costo
| Attività | Modello | Esecuzioni perfette | Tempo medio per esecuzione | Costo medio per esecuzione (US$) |
| Triage CI | Claude Opus 5.5 | 5/5 | 1 min 27 s | 0,24 |
| Triage CI | GPT-6 Sol | 5/5 | 18 s | 0,02 |
| Analisi dei log | Claude Opus 5.5 | 5/5 | 6 min 44 s | 1,68 |
| Analisi dei log | GPT-6 Sol | 2/5 | 1 min 41 s | 0,30 |
| Risolutore di dipendenze | Claude Opus 5.5 | 5/5 | 9 min 40 s | 1,42 |
| Risolutore di dipendenze | GPT-6 Sol | 4/5 | 6 min 28 s | 0,22 |
Gli errori segnalati di GPT-6 Sol
Nell’analisi dei log, due esecuzioni di Sol non hanno individuato lo stesso cliente: l’addebito originale risultava confermato 52 secondi dopo che un nuovo tentativo era andato a buon fine. In un’altra esecuzione, Sol ha contato 27 checkout falliti invece di 28.
Nel risolutore, una parentesi chiusa in più alla riga 78 ha provocato un errore di importazione: quella prova di Sol non ha superato nessuno dei 120 test nascosti. Claude Opus 5.5 ha completato tutte e cinque le esecuzioni di questa attività.
Cosa indicano i risultati per lo sviluppo
Nel triage CI i due modelli hanno ottenuto cinque prove perfette su cinque, ma Sol ha impiegato in media 18 secondi contro 1 minuto e 27 secondi per Opus 5.5. Anche nelle altre due attività Sol è stato più rapido e meno costoso per singola esecuzione, mentre Opus 5.5 ha registrato più prove perfette: cinque su cinque nell’analisi dei log e nel risolutore, contro rispettivamente due e quattro per Sol.
Per un flusso di lavoro in cui contano i dettagli corretti e l’esito viene verificato, le prove sui log e sul codice rendono visibile una differenza di risultati; il triage CI, invece, ha dato esito perfetto per entrambi. Sono indicazioni legate alle attività e alle condizioni descritte, non una classifica valida per ogni uso.
Una singola chiamata CI non è AutomationBench
La prova di triage CI consisteva in una singola chiamata al modello. OpenAI descrive AutomationBench come un workflow end-to-end che usa 47 strumenti: si tratta di un’impostazione diversa. Anche il confronto di lancio di OpenAI accostava GPT-6 Sol a Claude Opus 5, non a Claude Opus 5.5, e usava i livelli di effort xhigh per Sol e max per Opus 5. Questi risultati riguardano quindi versioni, attività e impostazioni differenti.