Cognition Fusion est le nouveau harness multi-modèle de Cognition pour Devin Desktop et Devin CLI. Annoncé le 11 septembre 2026, il confie la planification et la vérification à un modèle avancé, puis délègue des tâches de programmation délimitées à un sidekick moins coûteux. Le principe est simple : le premier garde le gouvernail, le second fait tourner la machine.

Ce qu’est Cognition Fusion

Fusion n’est ni un éditeur autonome ni un modèle séparé. C’est une couche de coordination pour les agents de développement de Devin. Cognition recommande Fable 5.1 comme lead et SWE-2 comme sidekick, même si les résultats publiés incluent aussi une configuration avec GPT-6 Astra.

Le lead construit le plan, interprète les exigences ambiguës, choisit ce qui peut être délégué et relit le travail retourné. Le sidekick reçoit une mission bornée, avec ses contraintes et ses critères de réussite ; il explore le dépôt, implémente les changements, exécute les tests et renvoie ses résultats.

Cette organisation répond à une question très concrète : comment utiliser un modèle avancé là où le jugement compte, sans lui faire consommer chaque jeton pour les tâches d’exécution plus mécaniques ?

Comment le lead et le sidekick collaborent

Les deux agents disposent de contextes persistants et de leurs propres outils. Ils n’échangent pas en permanence l’intégralité de leur conversation : Fusion fait circuler des briefs, des résultats et des retours.

En pratique, le cycle ressemble à ceci :

  1. Le lead comprend la demande et prépare un plan.
  2. Il transmet au sidekick une tâche précise, avec les limites et les critères attendus.
  3. Le sidekick inspecte le code, effectue les modifications et lance les vérifications prévues.
  4. Le lead examine le résultat et peut reprendre la main si la tâche dépasse les capacités du sidekick.

Ce dernier point distingue Fusion d’un simple routeur qui choisirait un modèle une seule fois au début d’une session. La responsabilité peut changer en cours de route. Le gain potentiel vient donc autant de la répartition du travail que du prix inférieur du modèle secondaire.

Ce que montrent les benchmarks

Cognition Fusion confie le code à un duo d’agents dans Devin

Cognition publie des résultats sur plusieurs benchmarks de programmation. Pour une comparaison lisible, voici les deux configurations de FrontierCode 1.1 Extended avec leur modèle solo correspondant :

Configuration leadConfiguration FusionScoreCoût moyen par tâcheÉvolution du coût annoncée
Fable 5.1 seulFable 5.1 + SWE-263,51,67 $38 % de moins
GPT-6 Astra seulGPT-6 Astra + SWE-263,42,34 $11 % de moins

Avec Fable 5.1, Fusion descend de 2,68 $ à 1,67 $ par tâche, tandis que le score passe de 63,6 à 63,5. Avec GPT-6 Astra, le coût passe de 2,62 $ à 2,34 $ et le score monte de 63,1 à 63,4.

La conclusion utile n’est donc pas « deux agents valent toujours mieux qu’un ». C’est plutôt celle-ci : Fusion vise un meilleur rapport entre coût d’exécution et résultat, avec un compromis qui varie selon le modèle et le benchmark.

L’interface affiche un exemple à 39 % moins cher que Fable 5.1 seul, avec 113 000 jetons attribués à Fable 5.1 et 97 000 à SWE-2, sur un total de 210 000 jetons. Ce pourcentage est une estimation calculée en valorisant les jetons du sidekick aux tarifs du modèle lead ; il ne s’agit pas d’une nouvelle exécution complète de la tâche avec le lead seul.

Un coût inférieur ne garantit pas le même score

Les résultats publiés ne suivent pas une ligne parfaitement droite. Sur DeepSWE 1.1, Fable 5.1 avec Fusion obtient 63,1 points contre 64,3 seul, pour un coût annoncé inférieur de 46 %. Sur Terminal-Bench 4, la configuration Fable passe de 57,6 à 56,1 points, tandis que la configuration Astra passe de 55,6 à 50 points.

D’autres essais sont plus favorables : Fable 5.1 avec Fusion atteint 65,9 contre 64,8 sur SWE-Atlas QnA, et 57,3 contre 54,6 sur Vals Code Migration. Les réductions de coût annoncées vont de 11 % à 46 % selon le benchmark et la paire de modèles.

Le message marketing de Cognition parle d’une efficacité pouvant atteindre 39 % dans sa comparaison actuelle, mais ce chiffre ne doit pas être transformé en économie garantie pour chaque dépôt, chaque tâche ou chaque compte. Le choix est intéressant surtout lorsque le travail peut être découpé proprement et que le lead conserve la revue finale. Une tâche qui exige un jugement subtil peut perdre en qualité lorsqu’elle est déléguée trop largement.

Autre distinction importante : les montants en dollars du tableau sont des coûts moyens d’évaluation par tâche. Ils ne correspondent pas au prix d’un abonnement Devin et ne prédisent pas une facture client précise.

L’accès via Devin

Fusion est proposé dans l’environnement Devin plutôt que comme un abonnement autonome. La documentation Devin indique un accès sur les offres payantes, à partir de Devin CLI 3000.10.20+ et de Devin Desktop 3.10.0+. Les offres gratuites et d’essai ne l’incluent pas.

Pour un développeur, le changement le plus concret est donc architectural : l’interface avec le lead reste le point d’entrée, tandis que les tâches d’exploration, d’implémentation et de test peuvent être confiées au sidekick. Les chiffres de Cognition suggèrent un potentiel d’économie, mais les scores mixtes rappellent la règle essentielle : déléguer le bon travail au bon agent compte davantage qu’un pourcentage affiché en gros.

Fusion apporte ainsi une manière plus fine de répartir l’effort dans Devin : le modèle le plus capable ne disparaît pas de la boucle, il intervient là où la planification, l’ambiguïté et la revue exigent le plus de jugement.