Cognition Fusion is een coördinatiesysteem voor meerdere AI-codeeragenten binnen Devin Desktop en Devin CLI. Cognition kondigde het op 11 september 2026 aan als een workflow waarin een geavanceerd model de planning en controle behoudt, terwijl een goedkoper sidekick-model afgebakend programmeerwerk uitvoert. De benchmarkresultaten wijzen op lagere kosten per taak, maar niet op een universele kwaliteitswinst.
Wat Cognition Fusion is
Fusion is geen losse editor of afzonderlijk abonnement, maar een manier om meerdere modellen binnen Devin samen te laten werken. De aanbevolen combinatie is Fable 5.1 als lead en SWE-2 als sidekick. Ook GPT-6 Astra wordt in de benchmarkvergelijkingen als lead gebruikt.
De lead blijft verantwoordelijk voor het grote plaatje: een plan maken, onduidelijke eisen interpreteren, bepalen welk werk kan worden gedelegeerd en het teruggekomen resultaat beoordelen. De sidekick krijgt vervolgens een afgebakende opdracht met beperkingen en succescriteria.
Dat maakt Fusion interessanter dan een simpele router die vooraf één model kiest. Tijdens een taak kan de lead de regie terugnemen wanneer het gedelegeerde werk niet goed bij de sidekick past.
Hoe lead en sidekick samenwerken
De verdeling is praktisch:
- De lead: plant, verduidelijkt ambiguïteit, delegeert en beoordeelt het resultaat.
- De sidekick: verkent de codebase, voert wijzigingen uit, draait builds en tests en rapporteert de uitkomst.
De twee agents hebben elk een eigen permanente context en toegang tot hun eigen tools. Ze sturen niet voortdurend hun volledige gespreksgeschiedenis naar elkaar. In plaats daarvan wisselen ze opdrachten, resultaten en feedback uit.
Dat beperkt de hoeveelheid context die opnieuw moet worden opgebouwd wanneer een ander model het werk overneemt. Voor jou betekent het vooral een duidelijkere taakgrens: de lead hoeft niet elk commando van de sidekick te volgen, maar krijgt wel de relevante uitkomst terug.
Wat de benchmarks laten zien
De meest directe vergelijking staat in FrontierCode 1.1 Extended. Cognition rapporteerde daar afzonderlijke resultaten voor Fable 5.1 en GPT-6 Astra, telkens met en zonder Fusion. De bedragen zijn gemiddelde evaluatiekosten per taak in Amerikaanse dollar, geen Devin-abonnementstarieven.
| Leadconfiguratie | Fusion-configuratie | Score | Gemiddelde kosten per taak | Gerapporteerde kostenverandering |
| Fable 5.1 | Fable 5.1 + SWE-2 Fusion | 63,5 tegenover 63,6 | $1,67 tegenover $2,68 | 38% lager |
| GPT-6 Astra | GPT-6 Astra + SWE-2 Fusion | 63,4 tegenover 63,1 | $2,34 tegenover $2,62 | 11% lager |
Bij Fable 5.1 ligt de score met Fusion dus 0,1 punt lager, terwijl de gerapporteerde kosten per taak dalen van $2,68 naar $1,67. Bij GPT-6 Astra stijgt de score met 0,3 punt en dalen de kosten van $2,62 naar $2,34. Dat is een nuttige tegenstelling: goedkoper betekent hier niet automatisch hoger scoren, en een kleine scorewinst zegt evenmin dat elke taak goedkoper wordt.
In de volledige benchmarktabel lopen de gerapporteerde kostenreducties per combinatie uiteen van 11% tot 46%. Cognition gebruikt daarnaast een voorbeeld met 39% lagere geschatte kosten. Die schatting rekent de tokens van de sidekick door tegen het tarief van het lead-model; het is geen gecontroleerde herhaling van dezelfde taak met alleen het geavanceerd model.
Waarom lagere kosten niet altijd dezelfde score betekenen
De architectuur werkt het best wanneer het gedelegeerde werk duidelijk afgebakend en technisch uitvoerbaar is. Code verkennen, een wijziging implementeren en tests draaien passen bij de rol van SWE-2. Werk dat veel subtiele interpretatie of een complex oordeel vraagt, kan minder geschikt zijn om uit handen te geven.
De benchmarkcijfers laten dat verschil zien. Op DeepSWE 1.1 daalde de Fable-score met Fusion van 64,3 naar 63,1, terwijl de kosten van $14,63 naar $7,88 gingen. Op Terminal-Bench 4 daalde de Astra-score van 55,6 naar 50,0 en de kosten van $10,08 naar $6,06. Daar staat tegenover dat Fable 5.1 met Fusion op SWE-Atlas QnA van 64,8 naar 65,9 ging, bij een kostendaling van $7,57 naar $5,00.
De juiste conclusie is dus bescheidener dan “twee agents presteren altijd als één duurder model”: Fusion probeert dure redeneerstappen te combineren met goedkoper uitvoerend werk, met wisselende uitkomsten per benchmark en taaktype.
Toegang via Devin
Fusion is beschikbaar binnen betaalde Devin-abonnementen. De documentatie noemt minimaal Devin CLI 3000.10.20+ en Devin Desktop 3.10.0+; gratis en proefabonnementen vallen erbuiten.
De benchmarkbedragen hierboven zijn evaluatiekosten per taak. Ze vertellen niet wat een gebruiker in Nederland voor een Devin-abonnement betaalt en zijn geen vaste rekening voor elke codeertaak. Voor ontwikkelaars die Fusion overwegen, zijn daarom vooral drie zaken relevant: de gebruikte leadconfiguratie, het soort werk dat je delegeert en de score-kostenverhouding van de benchmark die het dichtst bij je eigen workflow ligt.
Fusion is daarmee vooral een architectuurkeuze voor Devin: de dure lead blijft nadenken en controleren, terwijl SWE-2 het uitvoerende werk op zich neemt. De gerapporteerde cijfers maken de kostenbelofte interessant, maar de gemengde scores maken duidelijk waar je op moet letten.