W porównaniu z 6 października 2026 r. Mistral Large 4 Preview uzyskał 38 punktów w Artificial Analysis Intelligence Index v4.3.2. Pięć wymienionych w tym zestawieniu chińskich modeli z otwartymi wagami zdobyło od 39 do 46 punktów. W testach cyberbezpieczeństwa wyniki Mistrala układały się inaczej: 50 punktów w zbiorczym Cyber Index i 81,7% w jednym z testów składowych.
Wynik Intelligence Index z 6 października
Intelligence Index to wynik zbiorczy, który pozwala porównać modele w ramach konkretnego zestawu zadań. W tym zestawieniu najwyżej oceniono MiMo-V2.6-Pro, z wynikiem 46 punktów — o osiem więcej niż Mistral Large 4 Preview. Pozostałe cztery modele z otwartymi wagami, które wyprzedziły Mistrala, uzyskały od 39 do 45 punktów.
Wyniki wymienionych modeli
| Model i wariant | Punkty w Intelligence Index |
| MiMo-V2.6-Pro | 46 |
| GLM-5.3 (max) | 45 |
| Kimi K3 (max) | 44 |
| GLM-5.3-Flash | 42 |
| DeepSeek V4.1 Flash (max) | 39 |
| Mistral Large 4 Preview | 38 |
Wyniki opisują pozycję tych wariantów w jednym indeksie. W przypadku Mistrala pomiary z obszaru cyberbezpieczeństwa przynoszą inny obraz niż wynik zbiorczy.
W cyberbezpieczeństwie wyniki zależą od testu
Mistral Large 4 Preview uzyskał 50 punktów w Cyber Index — tyle samo co GLM-5.3-Flash w tym zestawieniu. Cyber Index jest wynikiem zbiorczym; CWE-Bench-AA, DeepsecBench-AA i CyberGym-E2E-AA to osobne testy składowe, podawane w procentach.
| Model i wariant | Cyber Index | CWE-Bench-AA | DeepsecBench-AA | CyberGym-E2E-AA |
| Grok 4.7 (xhigh) | 56 | 68% | 27% | 74% |
| MiMo-V2.6-Pro | 56 | 63% | 26% | 79% |
| GPT-6 Luna (max) | 53 | 57% | 24% | 78% |
| GLM-5.3-Flash | 50 | 56% | 20% | 74% |
| Mistral Large 4 Preview | 50 | 51% | 16% | 81,7% |
Wśród tych pięciu wariantów Mistral osiągnął najwyższy wynik w CyberGym-E2E-AA, ale najniższy w DeepsecBench-AA. Właśnie dlatego sam wynik zbiorczego indeksu ani rezultat pojedynczego testu nie opisują całego profilu modelu.
Co pokazują demonstracje programistyczne twórców?
Dwie demonstracje twórców pokazują zadania praktyczne, ale każde ma własny zestaw prób i własną punktację; nie są to standaryzowane odpowiedniki porównania indeksowego. W pierwszej autor testu przygotował redesign Wikipedii oraz świat LEGO South Park. Jego wyniki uplasowały te zadania odpowiednio na 13. i 9. miejscu własnych rankingów. W demonstracji gry pojawiły się problemy z poruszaniem się i fizyką, a redesign strony miał wąski, mobilny układ i niedopracowane animacje.
W drugiej demonstracji osiem zadań KingBench 3 wykonano w OpenCode przez OpenRouter. Wynik po korekcie uprawnień wyniósł 42/80, czyli 52,5%. Wśród udanych prób znalazły się symulacja windy i składany stół 3D; część zadań nie powiodła się albo wymagała ponownych prób. Do końcowego wyniku nie wliczono ponowień i napraw.
Preview i plan publikacji wag
Porównanie dotyczyło Mistral Large 4 Preview. Mistral AI ogłosiła publiczny podgląd modelu 6 października 2026 r. i zapowiedziała udostępnienie jego wag do końca października 2026 r. Wcześniej opisaliśmy publiczny podgląd Mistral Large 4.