Grok 4.6 zdobył 61 punktów w dostarczonym porównaniu premierowym Artificial Analysis Intelligence Index, remisując z GPT-5.6 Sol Max. To mocny start, ale nie ogólne zwycięstwo: model ma atrakcyjne standardowe stawki API i dobrze wypada w części zadań analitycznych, podczas gdy testy programistyczne pokazują bardziej mieszany obraz.

Wynik benchmarku Grok 4.6

Grok 4.6 remisuje w benchmarku, a API kosztuje mniej

W tabeli premierowej Grok 4.6 uzyskał 61 punktów, tyle samo co GPT-5.6 Sol Max. Claude Fable 5 Max zdobył 62 punkty. Ten wynik należy czytać razem z nazwą konkretnego testu i jego wersją — rezultatów z różnych wydań benchmarku nie można bezpośrednio mieszać ani traktować jak jednego, stałego rankingu.

Najkrótszy werdykt brzmi więc: Grok 4.6 jest konkurencyjny na szczycie, ale sama liczba 61 punktów nie dowodzi, że pokona każdy model i w każdym zadaniu.

Mocny, ale nie uniwersalny wynik

W dostarczonej tabeli premierowej Grok 4.6 prowadzi w GDPVal-AA v2 z wynikiem 1753 punktów. To benchmark ukierunkowany na pracę zawodową i zadania wiedzochłonne. W CursorBench v3.2 model osiągnął 69,9%, czyli mniej niż Claude Fable 5 Max (70,5%), ale więcej niż GPT-5.6 Sol Max (67,2%).

Obraz zmienia się przy testach związanych z autonomicznym programowaniem:

  • w DeepSWE v1.1 Grok 4.6 uzyskał 65,9%, podczas gdy GPT-5.6 Sol Max osiągnął 73%, a Claude Fable 5 Max 70%;
  • w Terminal-Bench v3.0 wynik Grok 4.6 wyniósł 26%, przy 34,6% dla GPT-5.6 Sol Max i 34,1% dla Claude Fable 5 Max;
  • w AA-Briefcase model zdobył 1577 punktów, nieco więcej niż Claude Fable 5 Max (1574) i wyraźnie więcej niż GPT-5.6 Sol Max (1502).

To sensowny profil dla narzędzia do analizy dokumentów, pracy biurowej i wieloetapowych zadań agenta. Nie jest natomiast podstawą do obietnicy, że Grok 4.6 samodzielnie najlepiej poprowadzi każdy projekt programistyczny.

Dlaczego liczy się liczba tur agenta

W zadaniu AA-Briefcase Grok 4.6 miał według opisywanego porównania potrzebować około 53 tur i około 500 mln tokenów wejściowych, podczas gdy Claude Opus 5 Max — około 103 tur i 2 mld tokenów wejściowych. Taka różnica jest interesująca, bo agent wykonujący długą pracę może wielokrotnie analizować pliki, planować kolejne kroki i korzystać z narzędzi.

Nie oznacza to jednak automatycznie niższego kosztu każdego projektu produkcyjnego. Końcowy rachunek zależy od liczby tokenów, użytych narzędzi, pamięci podręcznej, ustawień wysiłku modelu i konkretnego środowiska pracy. Benchmark pokazuje określony przebieg zadania, a nie gwarantowaną oszczędność w każdej aplikacji.

Ceny API i długi kontekst

Standardowa stawka API Grok 4.6 wynosi 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych. Dla tokenów wejściowych zapisanych w pamięci podręcznej podawana jest stawka 0,50 USD za milion tokenów.

Dla polskiego użytkownika ważna jest jeszcze jedna rzecz: dostępne dane podają ceny w dolarach i nie ustanawiają oficjalnego cennika w złotych. Nie warto więc przeliczać tej stawki na PLN jako ceny rozliczeniowej — rzeczywista kwota może zależeć od operatora płatności i warunków konta.

Pojawiają się także informacje o wyższych stawkach dla bardzo długich promptów oraz wariantów szybkiego lub priorytetowego przetwarzania. Nie traktuj ich jako uniwersalnego, potwierdzonego cennika. Przed wdrożeniem trzeba sprawdzić warunki obowiązujące dla konkretnego modelu i kanału dostępu.

Grok 4.6 ma deklarowane okno kontekstowe o wielkości 500 000 tokenów, obsługuje tekst i obrazy na wejściu, a generuje tekst. Własnościowy charakter modelu oznacza natomiast, że jego wagi nie są publicznie dostępne, a liczba parametrów nie została ujawniona.

Co pokazują testy praktyczne

Zsynchronizowane porównanie Grok 4.6, Claude Opus 5, Kimi K3 i GPT-5.6 Sol w zadaniach kreatywnego programowania

Testy kreatywnego programowania pokazują bardziej przyziemny obraz niż sama tabela wyników. W zsynchronizowanym porównaniu czterech modeli Grok 4.6 tworzył sceny 3D, interaktywne projekty i elementy gier, ale w zadaniu z symulatorem lotu nie zdołał wykonać procedury startu. To konkretny przykład różnicy między efektownym prototypem a działającą logiką całego projektu.

Trzeba przy tym zachować proporcje: był to test typu one-shot, czyli bez długiej serii poprawek i samodzielnego korygowania błędów. Dobrze pokazuje pierwszą odpowiedź modelu na złożone polecenie, ale nie rozstrzyga, jak Grok 4.6 zachowa się w iteracyjnym procesie pracy programisty.

Dla kogo Grok 4.6 ma sens

Grok 4.6 warto rozważyć, jeśli potrzebujesz modelu do:

  • analizy dużych dokumentów i pracy wiedzochłonnej;
  • wieloetapowych zadań agentowych, w których liczy się sprawne przechodzenie przez kolejne kroki;
  • prototypowania interaktywnych aplikacji i wizualnych projektów;
  • eksperymentów z API przy standardowych stawkach 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych.

Model jest dostępny przez SpaceXAI API, Cursor, Grok Build, OpenRouter, Vercel i Cloudflare, choć dostęp zależy od konta oraz konkretnego kanału. Dla zespołu, który potrzebuje publicznie dostępnych wag albo samodzielnego hostowania, nie będzie odpowiednim wyborem: Grok 4.6 jest modelem własnościowym.

Grok 4.7 nie ma potwierdzonej daty premiery. Elon Musk mówił o możliwym pojawieniu się modelu w ciągu trzech–czterech tygodni, ale była to prognoza, a nie oficjalny harmonogram wydania.

Wniosek: Grok 4.6 jest interesującym konkurentem dla osób, które łączą analizę długich zadań z kontrolą kosztów API. Jeśli najważniejsza jest niezawodna autonomia w złożonym programowaniu, wyniki DeepSWE v1.1, Terminal-Bench v3.0 i testów praktycznych sugerują, by nie wybierać go w ciemno — najlepiej sprawdzić go na własnych zadaniach i własnym limicie tokenów.