21 września 2026 roku xAI ogłosiło premierę Grok 4.7 — modelu przeznaczonego przede wszystkim do programowania, pracy wiedzochłonnej i długich zadań wykonywanych przez agentów. W oficjalnych testach Grok 4.7 poprawił wyniki względem Grok 4.6, ale nie został liderem całego zestawu: Fable 5.1 Max wyprzedza go między innymi w CursorBench 4.0, Terminal-Bench 4.0 i HealthBench Professional.

xAI wymienia dostęp przez Cursor, Grok Build, Grok API, zewnętrzne środowiska do pracy z kodem, routery modeli oraz platformy chmurowe. Firma podała cenę początkową 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych. Szybki wariant ma zapewniać dwukrotnie wyższą szybkość generowania przy dwukrotnie wyższych stawkach.

Co xAI zmieniło w Grok 4.7

xAI opisuje Grok 4.7 jako model oparty na nowej, większej bazie oraz dłuższym treningu z wykorzystaniem uczenia ze wzmocnieniem. Trening miał większy nacisk na trudne problemy, których rozwiązanie może zająć wiele godzin.

Firma twierdzi także, że model lepiej sprawdza własne odpowiedzi, zarządza dłuższym kontekstem i natywnie rozumie środowisko Grok Bot. To ważne dla pracy agentowej, w której model nie tylko odpowiada na pytanie, lecz także planuje kolejne kroki, korzysta z narzędzi i przekazuje zadania między wyspecjalizowanymi rolami.

W demonstracji środowiska Grok Bot można było przypisywać osobne role do zarządzania projektem, programowania i projektowania. Sama konfiguracja pokazuje sposób organizacji pracy, ale o jakości wyniku nadal decyduje konkretne zadanie i zastosowany przepływ pracy.

Gdzie Grok 4.7 wypada najlepiej

Oficjalna tabela xAI pokazuje poprawę względem Grok 4.6 we wszystkich wymienionych testach. Największa różnica widoczna jest w Terminal-Bench 4.0: Grok 4.7 uzyskał 38,0%, a Grok 4.6 — 20,3%. W Harvey Legal Agent Benchmark wyniki wyniosły odpowiednio 19,6% i 15,8%.

Benchmark i rodzaj zadaniaGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.0 — programowanie46,3%40,4%41,7%51,8%
DeepSWE v1.1 — inżynieria oprogramowania71,0%*65,2%72,7%70,0%
EEBench — inżynieria elektryczna64,0%53,0%39,4%56,4%
AA Briefcase v1.1 — wielogodzinna praca biurowa1657154614871678
Terminal-Bench 4.0 — zadania terminalowe38,0%20,3%37,3%57,9%
Harvey Legal Agent Benchmark — zadania prawne19,6%15,8%2,5%6,7%
HealthBench Professional — rozumowanie kliniczne56,7%48,5%60,5%62,1%

* W tabeli xAI wynik Grok 4.7 w DeepSWE v1.1 oznaczono jako rezultat uzyskany przy wysokim poziomie wysiłku.

Grok 4.7 prowadzi w tej tabeli nad Fable 5.1 Max w Harvey Legal Agent Benchmark i EEBench. W pozostałych zadaniach Fable 5.1 Max jest wyżej między innymi w CursorBench 4.0, AA Briefcase v1.1, Terminal-Bench 4.0 i HealthBench Professional. Odpowiedź na pytanie, czy Grok 4.7 pokonał wszystkich rywali, brzmi więc: nie.

Poza oficjalną tabelą wyniki także zależą od benchmarku i użytego środowiska narzędziowego. Nie ma jednego rezultatu, który sam rozstrzygałby przydatność modelu do każdego projektu.

Cena tokenów a koszt całego zadania

Stawka API dotyczy pojedynczych tokenów wejściowych i wyjściowych. Nie jest tym samym co koszt wykonania kompletnego zadania, ponieważ model może wygenerować różną liczbę tokenów, wykonać różną liczbę kroków i pracować w innym trybie wysiłku.

W danych przypisywanych Artificial Analysis Grok 4.7 zużywał około 81 000 tokenów wyjściowych na zadanie Intelligence Index. Dla Grok 4.6 było to około 36 000 tokenów, a dla GPT-6 Astra — około 27 000. Przy cenie 6 USD za milion tokenów wyjściowych daje to inną strukturę kosztów niż sama informacja, że stawka za milion tokenów jest niska.

Dlatego porównując modele do pracy agentowej, trzeba zestawić co najmniej trzy elementy: cenę wejścia, cenę wyjścia oraz liczbę tokenów potrzebnych do ukończenia konkretnego zadania. Sama cena katalogowa nie przesądza o końcowym rachunku.

Dostęp i zastosowania

Grok 4.7 jest przeznaczony do programowania, pracy z wiedzą, zadań terminalowych oraz długich procesów agentowych. xAI wymienia jako kanały dostępu Cursor, Grok Build, Grok API, zewnętrzne środowiska programistyczne, routery modeli i platformy chmurowe.

Dla osoby budującej aplikację najważniejsza będzie możliwość użycia modelu przez API i dobrania trybu pracy do budżetu. Dla zespołu pracującego w edytorze kodu większe znaczenie może mieć integracja z konkretnym środowiskiem oraz wynik w testach odpowiadających jego zadaniom. To właśnie tutaj Grok 4.7 wygląda interesująco: poprawił się względem poprzednika, ale jego przewaga nie jest jednakowa w każdej kategorii.

Grok 4.7 to więc konkretna aktualizacja z lepszymi wynikami w wielu testach i niezmienioną podstawową strukturą cen względem Grok 4.6. Wybór między nim a konkurencyjnymi modelami nadal zależy od tego, czy ważniejsze są programowanie, praca terminalowa, analiza prawna, zadania biurowe czy rozumowanie kliniczne.