Cognition Fusion to wielomodelowy mechanizm agentów kodujących dostępny w Devin Desktop i Devin CLI. Cognition ogłosiło go 11 września 2026 roku: mocniejszy model prowadzi sesję, planuje pracę i ocenia rezultat, a tańszy sidekick wykonuje wyznaczone zadania techniczne. To próba obniżenia kosztu pracy bez oddawania całego procesu jednemu modelowi.
Czym jest Cognition Fusion
Fusion nie jest osobnym edytorem ani samodzielnym modelem. To warstwa organizująca współpracę dwóch agentów w środowisku Devin. Cognition rekomenduje zestaw Fable 5.1 jako lead oraz SWE-2 jako sidekick.
Lead, czyli model prowadzący, tworzy plan, interpretuje niejasne wymagania, decyduje, co przekazać dalej, a następnie przegląda otrzymany rezultat. Sidekick dostaje ograniczony brief z zadaniem, ograniczeniami i kryteriami sukcesu. Potem eksploruje repozytorium, wprowadza zmiany, uruchamia testy i przekazuje wynik.
To ważne rozróżnienie. Fusion nie sprowadza się do jednorazowego wyboru tańszego modelu przed rozpoczęciem pracy. W trakcie sesji lead może przejąć zadanie z powrotem, jeśli zakres pracy okaże się zbyt trudny dla sidekicka.
Jak lead i sidekick dzielą pracę
Przepływ wygląda następująco:
- Lead rozumie cel i rozpisuje plan.
- Lead przekazuje sidekickowi konkretny fragment pracy wraz z ograniczeniami i kryteriami sukcesu.
- Sidekick bada kod, implementuje zmiany oraz uruchamia testy.
- Sidekick odsyła opis zmian i wyniki testów.
- Lead przegląda rezultat i może kontynuować pracę albo przejąć ją z powrotem.
Oba agenty zachowują własny trwały kontekst i dostęp do narzędzi. Nie przekazują sobie bez przerwy pełnej historii rozmowy. Zamiast tego wymieniają briefy, rezultaty i informacje zwrotne. Taki podział ogranicza konieczność ponownego budowania całego kontekstu przy zmianie modelu i ma pomagać w korzystaniu z pamięci podręcznej promptów.
Co pokazują benchmarki
Najbardziej użyteczne porównanie dotyczy testu FrontierCode 1.1 Extended, w którym zestawiono Fusion z odpowiadającym mu wariantem solo. Wyniki Cognition obejmują zarówno rezultat punktowy, jak i średni koszt jednego zadania.
| Konfiguracja lead | Konfiguracja Fusion | Wynik | Średni koszt zadania | Zgłoszona zmiana kosztu |
| Fable 5.1 | Fable 5.1 + SWE-2 | 63,5 punktu | 1,67 USD | 38% mniej |
| Astra | Astra + SWE-2 | 63,4 punktu | 2,34 USD | 11% mniej |
W przypadku Fable 5.1 Fusion uzyskał 63,5 punktu przy koszcie 1,67 USD za zadanie, podczas gdy sam Fable 5.1 osiągnął 63,6 punktu i koszt 2,68 USD. Wynik jest więc niemal identyczny, ale koszt testowego zadania był niższy.
Dla konfiguracji Astra wynik Fusion wyniósł 63,4 punktu i 2,34 USD za zadanie. Wariant solo osiągnął 63,1 punktu przy koszcie 2,62 USD. W tym zestawieniu Fusion miał nieco wyższy wynik i niższy koszt, ale różnica punktowa pozostaje niewielka.
Skąd bierze się podawane 39%
Cognition pokazuje również sesję, w której Fusion ma być o 39% tańszy od użycia samego Claude Fable 5.1. To szacunek wyliczony przez przeliczenie tokenów sidekicka według stawek modelu lead, a nie pomiar polegający na ponownym uruchomieniu tego samego zadania wyłącznie z leadem.
W tej sesji Fable 5.1 wykorzystuje 113 tys. tokenów, SWE-2 — 97 tys., a łączna liczba tokenów wynosi 210 tys. Wartość 39% opisuje konkretny przykład kosztowy. Nie jest ceną subskrypcji, rachunkiem gwarantowanym dla użytkownika ani stałą oszczędnością dla każdego repozytorium.
Niższy koszt nie oznacza zawsze tego samego wyniku
W szerszym zestawie testów oszczędności kosztu różnią się zależnie od benchmarku i konfiguracji. W tabelach Cognition spadki kosztu wynoszą od 11% do 46%, a wynik punktowy Fusion bywa zarówno zbliżony do bazowego, jak i niższy.
Przykładowo, w DeepSWE 1.1 połączenie Fable 5.1 z SWE-2 uzyskało 63,1 punktu przy koszcie 7,88 USD za zadanie, wobec 64,3 punktu i 14,63 USD dla samego Fable 5.1. W Terminal-Bench 4 wariant Fable 5.1 z Fusion osiągnął 56,1 punktu i koszt 13,37 USD, a konfiguracja solo — 57,6 punktu i 17,46 USD.
To właśnie tutaj widać sensowny sposób interpretacji Fusion: mniejszy koszt może być atrakcyjny przy mechanicznych, dobrze ograniczonych zadaniach, ale nie daje automatycznie tego samego poziomu wyniku w każdym typie pracy. Zadania wymagające subtelnej oceny mogą ucierpieć, jeśli zostaną niewłaściwie przekazane sidekickowi.
Kwoty w benchmarkach są średnimi kosztami wykonania zadań w testach. Nie należy traktować ich jako polskich cen subskrypcji Devin ani jako prognozy rachunku za konkretny projekt.
Dostęp przez Devin
Fusion jest funkcją środowiska Devin, a nie osobną subskrypcją. Dokumentacja Devin wskazuje dostęp w płatnych planach, z wyłączeniem planów bezpłatnych i próbnych. Wymagana jest wersja Devin CLI 3000.10.20 lub nowsza albo Devin Desktop 3.10.0 lub nowsza.
Dla programisty najważniejsza konsekwencja jest praktyczna: Fusion może przejąć część pracy wykonawczej, ale nadal utrzymuje człowieka i leadowy model w centrum kontroli zadania. Warto więc oceniać go nie przez pojedynczy procent oszczędności, lecz przez to, czy w konkretnym projekcie delegowane fragmenty są wystarczająco jednoznaczne, by tańszy sidekick wykonał je bez kosztownej serii poprawek.