Grok 4.6 zdobył 61 punktów w dostarczonym porównaniu premierowym Artificial Analysis Intelligence Index, remisując z GPT-5.6 Sol Max. To mocny start, ale nie ogólne zwycięstwo: model ma atrakcyjne standardowe stawki API i dobrze wypada w części zadań analitycznych, podczas gdy testy programistyczne pokazują bardziej mieszany obraz.
Wynik benchmarku Grok 4.6
W tabeli premierowej Grok 4.6 uzyskał 61 punktów, tyle samo co GPT-5.6 Sol Max. Claude Fable 5 Max zdobył 62 punkty. Ten wynik należy czytać razem z nazwą konkretnego testu i jego wersją — rezultatów z różnych wydań benchmarku nie można bezpośrednio mieszać ani traktować jak jednego, stałego rankingu.
Najkrótszy werdykt brzmi więc: Grok 4.6 jest konkurencyjny na szczycie, ale sama liczba 61 punktów nie dowodzi, że pokona każdy model i w każdym zadaniu.
Mocny, ale nie uniwersalny wynik
W dostarczonej tabeli premierowej Grok 4.6 prowadzi w GDPVal-AA v2 z wynikiem 1753 punktów. To benchmark ukierunkowany na pracę zawodową i zadania wiedzochłonne. W CursorBench v3.2 model osiągnął 69,9%, czyli mniej niż Claude Fable 5 Max (70,5%), ale więcej niż GPT-5.6 Sol Max (67,2%).
Obraz zmienia się przy testach związanych z autonomicznym programowaniem:
- w DeepSWE v1.1 Grok 4.6 uzyskał 65,9%, podczas gdy GPT-5.6 Sol Max osiągnął 73%, a Claude Fable 5 Max 70%;
- w Terminal-Bench v3.0 wynik Grok 4.6 wyniósł 26%, przy 34,6% dla GPT-5.6 Sol Max i 34,1% dla Claude Fable 5 Max;
- w AA-Briefcase model zdobył 1577 punktów, nieco więcej niż Claude Fable 5 Max (1574) i wyraźnie więcej niż GPT-5.6 Sol Max (1502).
To sensowny profil dla narzędzia do analizy dokumentów, pracy biurowej i wieloetapowych zadań agenta. Nie jest natomiast podstawą do obietnicy, że Grok 4.6 samodzielnie najlepiej poprowadzi każdy projekt programistyczny.
Dlaczego liczy się liczba tur agenta
W zadaniu AA-Briefcase Grok 4.6 miał według opisywanego porównania potrzebować około 53 tur i około 500 mln tokenów wejściowych, podczas gdy Claude Opus 5 Max — około 103 tur i 2 mld tokenów wejściowych. Taka różnica jest interesująca, bo agent wykonujący długą pracę może wielokrotnie analizować pliki, planować kolejne kroki i korzystać z narzędzi.
Nie oznacza to jednak automatycznie niższego kosztu każdego projektu produkcyjnego. Końcowy rachunek zależy od liczby tokenów, użytych narzędzi, pamięci podręcznej, ustawień wysiłku modelu i konkretnego środowiska pracy. Benchmark pokazuje określony przebieg zadania, a nie gwarantowaną oszczędność w każdej aplikacji.
Ceny API i długi kontekst
Standardowa stawka API Grok 4.6 wynosi 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych. Dla tokenów wejściowych zapisanych w pamięci podręcznej podawana jest stawka 0,50 USD za milion tokenów.
Dla polskiego użytkownika ważna jest jeszcze jedna rzecz: dostępne dane podają ceny w dolarach i nie ustanawiają oficjalnego cennika w złotych. Nie warto więc przeliczać tej stawki na PLN jako ceny rozliczeniowej — rzeczywista kwota może zależeć od operatora płatności i warunków konta.
Pojawiają się także informacje o wyższych stawkach dla bardzo długich promptów oraz wariantów szybkiego lub priorytetowego przetwarzania. Nie traktuj ich jako uniwersalnego, potwierdzonego cennika. Przed wdrożeniem trzeba sprawdzić warunki obowiązujące dla konkretnego modelu i kanału dostępu.
Grok 4.6 ma deklarowane okno kontekstowe o wielkości 500 000 tokenów, obsługuje tekst i obrazy na wejściu, a generuje tekst. Własnościowy charakter modelu oznacza natomiast, że jego wagi nie są publicznie dostępne, a liczba parametrów nie została ujawniona.
Co pokazują testy praktyczne
Testy kreatywnego programowania pokazują bardziej przyziemny obraz niż sama tabela wyników. W zsynchronizowanym porównaniu czterech modeli Grok 4.6 tworzył sceny 3D, interaktywne projekty i elementy gier, ale w zadaniu z symulatorem lotu nie zdołał wykonać procedury startu. To konkretny przykład różnicy między efektownym prototypem a działającą logiką całego projektu.
Trzeba przy tym zachować proporcje: był to test typu one-shot, czyli bez długiej serii poprawek i samodzielnego korygowania błędów. Dobrze pokazuje pierwszą odpowiedź modelu na złożone polecenie, ale nie rozstrzyga, jak Grok 4.6 zachowa się w iteracyjnym procesie pracy programisty.
Dla kogo Grok 4.6 ma sens
Grok 4.6 warto rozważyć, jeśli potrzebujesz modelu do:
- analizy dużych dokumentów i pracy wiedzochłonnej;
- wieloetapowych zadań agentowych, w których liczy się sprawne przechodzenie przez kolejne kroki;
- prototypowania interaktywnych aplikacji i wizualnych projektów;
- eksperymentów z API przy standardowych stawkach 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych.
Model jest dostępny przez SpaceXAI API, Cursor, Grok Build, OpenRouter, Vercel i Cloudflare, choć dostęp zależy od konta oraz konkretnego kanału. Dla zespołu, który potrzebuje publicznie dostępnych wag albo samodzielnego hostowania, nie będzie odpowiednim wyborem: Grok 4.6 jest modelem własnościowym.
Grok 4.7 nie ma potwierdzonej daty premiery. Elon Musk mówił o możliwym pojawieniu się modelu w ciągu trzech–czterech tygodni, ale była to prognoza, a nie oficjalny harmonogram wydania.
Wniosek: Grok 4.6 jest interesującym konkurentem dla osób, które łączą analizę długich zadań z kontrolą kosztów API. Jeśli najważniejsza jest niezawodna autonomia w złożonym programowaniu, wyniki DeepSWE v1.1, Terminal-Bench v3.0 i testów praktycznych sugerują, by nie wybierać go w ciemno — najlepiej sprawdzić go na własnych zadaniach i własnym limicie tokenów.