Cognition anunció Fusion el 11 de septiembre de 2026 como un harness —una estructura que coordina modelos, herramientas y contexto— para sus agentes de programación. Funciona dentro de Devin Desktop y Devin CLI: un modelo líder se ocupa de planificar, interpretar requisitos ambiguos y revisar el resultado, mientras un sidekick de menor coste explora el código, implementa cambios, ejecuta pruebas y devuelve sus conclusiones.
No es un editor independiente ni un nuevo modelo. La apuesta de Cognition consiste en repartir el trabajo sin quitarle el control al agente principal. Y ahí está la parte interesante: gastar menos no implica prometer que cada tarea terminará con exactamente la misma calidad.
Cómo trabajan el modelo líder y el sidekick
El modelo líder permanece al frente de la sesión. Decide qué parte del trabajo puede delegarse, prepara un encargo con restricciones y criterios de éxito, interpreta las ambigüedades y revisa lo que vuelve. Si el sidekick se atasca con una tarea que exige más criterio, el líder puede recuperar el control.
El sidekick recibe un trabajo delimitado. Su papel es inspeccionar el repositorio, proponer e implementar cambios, ejecutar compilaciones o pruebas y comunicar qué ha hecho y qué resultados ha obtenido. Cognition recomienda emparejar Fable 5.1 como líder con SWE-2 como sidekick, aunque la tabla de resultados también incluye una configuración con GPT-6 Astra.
En la práctica, la persona usuaria interactúa con el agente líder y no necesita seguir cada salida de herramientas del sidekick. La división busca reservar el modelo más capaz para las decisiones que requieren contexto y usar el modelo de menor coste para el trabajo de ingeniería más acotado.
Por qué importan los contextos separados
Fusion no envía continuamente toda la conversación de un agente al otro. Cada uno conserva su propio contexto persistente y sus herramientas, y ambos intercambian briefs, resultados y comentarios.
Ese diseño reduce la necesidad de reconstruir una sesión completa cada vez que cambia el modelo. También delimita mejor qué debe saber el sidekick para completar su encargo: recibe la tarea, las restricciones y los criterios de éxito, no necesariamente todo el historial que llevó al agente líder hasta ese punto.
La diferencia frente a un enrutador sencillo es que Fusion puede cambiar la responsabilidad durante el trabajo. No se limita a escoger un modelo al principio y dejarlo funcionar hasta el final: el líder revisa la devolución y puede intervenir de nuevo cuando sea necesario.
Qué muestran los benchmarks
La comparación más clara aparece en FrontierCode 1.1 Extended, donde Cognition enfrentó cada configuración Fusion con su modelo individual correspondiente. La puntuación mide el resultado del benchmark y el coste es el promedio comunicado por tarea, no una factura de Devin.
| Configuración líder | Configuración Fusion | Puntuación | Coste medio por tarea | Cambio de coste comunicado |
| Fable 5.1 | Fable 5.1 + SWE-2 | 63,5 | 1,67 USD | 38 % menos |
| GPT-6 Astra | GPT-6 Astra + SWE-2 | 63,4 | 2,34 USD | 11 % menos |
En el caso de Fable 5.1, Fusion reduce el coste medio de 2,68 a 1,67 dólares por tarea, pero la puntuación pasa de 63,6 a 63,5. Con GPT-6 Astra, la puntuación sube de 63,1 a 63,4 y el coste baja de 2,62 a 2,34 dólares.
La lectura correcta no es «dos agentes siempre rinden igual que uno caro». Es más concreta: en esas dos configuraciones y bajo ese benchmark, Fusion se acerca mucho a la línea base mientras reduce el coste comunicado. En otras pruebas de la misma batería, el ahorro varía entre el 11 % y el 46 %, y varias puntuaciones de Fusion quedan por debajo de las configuraciones individuales correspondientes.
La captura de sesión muestra otro ejemplo: 39 % menos coste estimado frente a usar Claude Fable 5.1 en solitario, con 113.000 tokens de Fable 5.1 y 97.000 de SWE-2, sobre un total de 210.000. Es una estimación calculada aplicando las tarifas del modelo líder a los tokens del sidekick, no una repetición controlada de la tarea completa con Fable 5.1.
Pagar menos no significa rendir siempre igual
Los resultados publicados dibujan un intercambio, no una garantía universal. En DeepSWE 1.1, Fable 5.1 con Fusion alcanza 63,1 puntos frente a 64,3 de Fable 5.1 solo, aunque el coste comunicado baja de 14,63 a 7,88 dólares por tarea. En Terminal-Bench 4, Astra con Fusion obtiene 50,0 puntos frente a 55,6 de Astra, con un coste de 6,06 frente a 10,08 dólares.
La delegación parece más favorable cuando el trabajo está bien delimitado y es mecánico. Las tareas que dependen de un juicio sutil pueden perder calidad si se asignan al agente equivocado. Para un equipo, la pregunta útil no es si Fusion «vence» a un modelo avanzado, sino qué partes del flujo merece la pena delegar y cuáles deben permanecer bajo revisión del líder.
Conviene separar tres cifras que suelen mezclarse:
- Puntuación: el resultado dentro de un benchmark concreto.
- Coste por tarea: el gasto medio comunicado para esa evaluación, expresado aquí en dólares.
- Precio de Devin: la tarifa del plan que permite utilizar el producto, que no se deduce de los costes de benchmark.
Acceso a través de Devin
Fusion se ofrece dentro de Devin, no como una suscripción independiente. La documentación de Devin indica que está disponible en planes de pago y excluye los niveles gratuitos y de prueba. El requisito mínimo indicado es Devin CLI 3000.10.20 o posterior o Devin Desktop 3.10.0 o posterior.
Cognition presentó Fusion para Devin Desktop y Devin CLI el 11 de septiembre de 2026. La disponibilidad del sistema se entiende, por tanto, dentro de esos productos y sus planes compatibles; los costes por tarea de la tabla no sustituyen la información comercial del plan.
Para quien programa con agentes de IA, Fusion ofrece una idea sencilla pero potente: conservar un modelo con capacidad de decisión para el plan y la revisión, y enviar el trabajo acotado a un modelo más barato. Los benchmarks indican que ese reparto puede recortar el coste manteniendo puntuaciones cercanas en algunas pruebas, pero también que la factura y el resultado dependen del benchmark, del modelo líder y del tipo de tarea.