Una comparación externa de API, publicada el 28 de septiembre de 2026, informó de 15 ejecuciones perfectas para Claude Opus 5.5 y 12 para GPT-6 Sol en tres tareas de desarrollo, repetidas cinco veces por modelo. GPT-6 Sol fue más rápido y menos costoso por ejecución en las tres.
La prueba usó los mismos prompts y el nivel máximo de esfuerzo disponible para cada modelo, descrito como «max».
Las tres tareas de desarrollo repetidas
El triaje de integración continua (CI) planteó cómo actuar ante 40 trabajos de CI fallidos y un procedimiento condicional: reintentar, bloquear o avisar. Ambos modelos completaron correctamente las cinco ejecuciones.
Para analizar la interrupción, se les dieron 3.664 líneas de registros de cinco servicios durante un corte de dos horas y siete preguntas. En la tarea de programación, debían implementar un resolvedor de dependencias a partir de una especificación de dos páginas; el resultado se evaluó con 120 pruebas ocultas.
Resultados por tarea: aciertos, tiempo y coste
Los promedios de tiempo y coste corresponden a cada ejecución. El coste está expresado en dólares estadounidenses.
| Tarea (5 ejecuciones por modelo) | Claude Opus 5.5: ejecuciones perfectas | GPT-6 Sol: ejecuciones perfectas | Tiempo medio por ejecución (Opus 5.5 / Sol) | Coste informado por ejecución (Opus 5.5 / Sol) |
| Triaje de CI | 5/5 | 5/5 | 1 min 27 s / 18 s | 0,24 US$ / 0,02 US$ |
| Análisis de registros de la interrupción | 5/5 | 2/5 | 6 min 44 s / 1 min 41 s | 1,68 US$ / 0,30 US$ |
| Especificación del resolvedor | 5/5 | 4/5 | 9 min 40 s / 6 min 28 s | 1,42 US$ / 0,22 US$ |
Los errores que explican las ejecuciones fallidas de GPT-6 Sol
En el análisis de registros, dos ejecuciones de GPT-6 Sol pasaron por alto al mismo cliente: el cargo original se confirmó 52 segundos después de que un reintento tuviera éxito. En otra ejecución, el modelo contó 27 pagos fallidos en vez de 28.
En una de las ejecuciones del resolvedor, un paréntesis de cierre sobrante en la línea 78 provocó un error de importación y el fallo de las 120 pruebas ocultas. Un detalle pequeño en el código bastó para arruinar esa ejecución.
Qué aportan estos resultados al trabajo de desarrollo
En estas tareas, Claude Opus 5.5 consiguió más ejecuciones perfectas: aventajó a GPT-6 Sol en el análisis de registros y en la implementación del resolvedor, mientras que ambos acertaron las cinco veces en el triaje de CI. GPT-6 Sol tuvo menor tiempo medio y menor coste informado por ejecución en cada caso.
Para un equipo que compara modelos para un flujo de trabajo concreto, los resultados plantean dos medidas distintas: cuántas veces la respuesta supera el criterio de la tarea y cuánto tarda y cuesta cada ejecución. Aquí, ambas importan: el modelo más rápido y barato no obtuvo el mayor número de ejecuciones perfectas.
Una llamada de CI no equivale a AutomationBench
La tarea de CI fue una sola llamada. OpenAI describe AutomationBench como un flujo de trabajo de extremo a extremo que utiliza 47 herramientas, así que sus resultados corresponden a una evaluación distinta. La comparación de lanzamiento de OpenAI enfrentó GPT-6 Sol con Claude Opus 5 —no con Claude Opus 5.5— y usó los niveles de esfuerzo xhigh y max, respectivamente.