Em um teste externo de API com três tarefas de desenvolvimento, Claude Opus 5.5 alcançou 15 execuções perfeitas em 15, contra 12 do GPT-6 Sol. O Sol teve menor tempo médio e menor custo informado por execução nas três tarefas. Cada modelo foi avaliado cinco vezes em cada tarefa, usando sua configuração de maior esforço. O relato do teste foi publicado em 28 de setembro de 2026.

Como foram feitas as três tarefas

A avaliação repetiu uma tarefa de triagem de integração contínua (CI), uma análise de registros de uma interrupção de serviço e a implementação de um resolvedor de dependências a partir de uma especificação. Em cada caso, houve cinco execuções por modelo.

Na triagem de CI, o modelo precisava analisar 40 falhas de integração e seguir um runbook condicional para decidir se deveria tentar novamente, bloquear ou acionar alguém. Na tarefa dos registros, precisava responder a sete perguntas com base em 3.664 linhas de logs de cinco serviços durante uma interrupção de duas horas. Já o resolvedor foi avaliado por uma bateria oculta de 120 testes.

Resultados por tarefa: execuções perfeitas, tempo e custo

O Claude Opus 5.5 teve mais execuções perfeitas nas tarefas de logs e de implementação do resolvedor. O GPT-6 Sol foi mais rápido e teve menor custo informado por execução nas três tarefas.

Tarefa (5 execuções por modelo)Claude Opus 5.5: execuções perfeitasGPT-6 Sol: execuções perfeitasTempo médio por execução (Opus 5.5 / Sol)Custo informado por execução (Opus 5.5 / Sol)
Triagem de CI5/55/51 min 27 s / 18 sUS$ 0,24 / US$ 0,02
Análise de logs de incidente5/52/56 min 44 s / 1 min 41 sUS$ 1,68 / US$ 0,30
Especificação de resolvedor5/54/59 min 40 s / 6 min 28 sUS$ 1,42 / US$ 0,22

O que falhou nas execuções do GPT-6 Sol

Na análise dos logs, duas execuções do Sol deixaram passar o mesmo cliente, cuja cobrança original foi confirmada 52 segundos depois que uma nova tentativa deu certo. Em outra execução, o modelo contou 27 checkouts com falha, em vez de 28.

No resolvedor, uma das cinco execuções do Sol terminou com um parêntese de fechamento sobrando na linha 78. O erro provocou uma falha de importação e fez a execução falhar nos 120 testes ocultos.

O que os resultados indicam para tarefas de desenvolvimento

Nas três tarefas, o Opus 5.5 teve mais execuções perfeitas no total: 15 de 15, contra 12 de 15 do Sol. A diferença apareceu sobretudo na análise de logs, em que o Sol foi perfeito em duas das cinco execuções, e no resolvedor, em que acertou quatro de cinco.

O Sol, por sua vez, levou menos tempo e teve menor custo informado por execução em cada tarefa. Para um fluxo em que um erro pode passar despercebido, a contagem de execuções perfeitas merece atenção junto com velocidade e custo. Os resultados dizem respeito a essas três tarefas e às condições usadas no teste; não determinam qual modelo é melhor para todo tipo de trabalho de desenvolvimento.

Uma chamada de CI não equivale ao AutomationBench

A tarefa de CI foi feita em uma única chamada. Já a OpenAI descreve o AutomationBench como um fluxo de ponta a ponta que utiliza 47 ferramentas. São avaliações diferentes.

A comparação de lançamento da OpenAI também usou outro par de modelos e configurações: GPT-6 Sol em xhigh contra Claude Opus 5 em max. Ela não corresponde ao teste de três tarefas, que comparou GPT-6 Sol com Claude Opus 5.5.