W porównaniu z 6 października 2026 r. Mistral Large 4 Preview uzyskał 38 punktów w Artificial Analysis Intelligence Index v4.3.2. Pięć wymienionych w tym zestawieniu chińskich modeli z otwartymi wagami zdobyło od 39 do 46 punktów. W testach cyberbezpieczeństwa wyniki Mistrala układały się inaczej: 50 punktów w zbiorczym Cyber Index i 81,7% w jednym z testów składowych.

Wynik Intelligence Index z 6 października

Intelligence Index to wynik zbiorczy, który pozwala porównać modele w ramach konkretnego zestawu zadań. W tym zestawieniu najwyżej oceniono MiMo-V2.6-Pro, z wynikiem 46 punktów — o osiem więcej niż Mistral Large 4 Preview. Pozostałe cztery modele z otwartymi wagami, które wyprzedziły Mistrala, uzyskały od 39 do 45 punktów.

Wyniki wymienionych modeli

Model i wariantPunkty w Intelligence Index
MiMo-V2.6-Pro46
GLM-5.3 (max)45
Kimi K3 (max)44
GLM-5.3-Flash42
DeepSeek V4.1 Flash (max)39
Mistral Large 4 Preview38

Wyniki opisują pozycję tych wariantów w jednym indeksie. W przypadku Mistrala pomiary z obszaru cyberbezpieczeństwa przynoszą inny obraz niż wynik zbiorczy.

W cyberbezpieczeństwie wyniki zależą od testu

Mistral Large 4 Preview uzyskał 50 punktów w Cyber Index — tyle samo co GLM-5.3-Flash w tym zestawieniu. Cyber Index jest wynikiem zbiorczym; CWE-Bench-AA, DeepsecBench-AA i CyberGym-E2E-AA to osobne testy składowe, podawane w procentach.

Model i wariantCyber IndexCWE-Bench-AADeepsecBench-AACyberGym-E2E-AA
Grok 4.7 (xhigh)5668%27%74%
MiMo-V2.6-Pro5663%26%79%
GPT-6 Luna (max)5357%24%78%
GLM-5.3-Flash5056%20%74%
Mistral Large 4 Preview5051%16%81,7%

Wśród tych pięciu wariantów Mistral osiągnął najwyższy wynik w CyberGym-E2E-AA, ale najniższy w DeepsecBench-AA. Właśnie dlatego sam wynik zbiorczego indeksu ani rezultat pojedynczego testu nie opisują całego profilu modelu.

Co pokazują demonstracje programistyczne twórców?

Anglojęzyczna demonstracja redesignu Wikipedii i świata LEGO South Park; autor podał miejsca 13. i 9. w dwóch własnych zadaniach.
Anglojęzyczna demonstracja ośmiu zadań KingBench 3; końcowy wynik wyniósł 42/80 (52,5%) po korekcie uprawnień.

Dwie demonstracje twórców pokazują zadania praktyczne, ale każde ma własny zestaw prób i własną punktację; nie są to standaryzowane odpowiedniki porównania indeksowego. W pierwszej autor testu przygotował redesign Wikipedii oraz świat LEGO South Park. Jego wyniki uplasowały te zadania odpowiednio na 13. i 9. miejscu własnych rankingów. W demonstracji gry pojawiły się problemy z poruszaniem się i fizyką, a redesign strony miał wąski, mobilny układ i niedopracowane animacje.

W drugiej demonstracji osiem zadań KingBench 3 wykonano w OpenCode przez OpenRouter. Wynik po korekcie uprawnień wyniósł 42/80, czyli 52,5%. Wśród udanych prób znalazły się symulacja windy i składany stół 3D; część zadań nie powiodła się albo wymagała ponownych prób. Do końcowego wyniku nie wliczono ponowień i napraw.

Preview i plan publikacji wag

Porównanie dotyczyło Mistral Large 4 Preview. Mistral AI ogłosiła publiczny podgląd modelu 6 października 2026 r. i zapowiedziała udostępnienie jego wag do końca października 2026 r. Wcześniej opisaliśmy publiczny podgląd Mistral Large 4.