Mistral Large 4 Preview scoorde 38 op de Artificial Analysis Intelligence Index v4.3.2 in de vergelijking van 6 oktober 2026. Vijf genoemde Chinese modellen met open gewichten kwamen hoger uit, met scores van 39 tot 46. Op de Cyber Index en de bijbehorende deeltests zag het resultaat er anders uit.

Mistral Large 4 Preview scoorde 38 op 6 oktober

De Intelligence Index-score zet Mistral Large 4 Preview onder vijf Chinese modellen met open gewichten in de genoemde vergelijking. Xiaomi MiMo-V2.6-Pro haalde met 46 de hoogste score van die zes modellen; dat is acht punten meer dan Mistrals 38.

ModelScore op de Intelligence Index
Xiaomi MiMo-V2.6-Pro46
Z.ai GLM-5.3 (max)45
Moonshot Kimi K3 (max)44
Z.ai GLM-5.3-Flash42
DeepSeek V4.1 Flash (max)39
Mistral Large 4 Preview38

Dit zijn scores op één index, geen universele ranglijst voor iedere taak. De modelvariant en de test zijn van belang: een uitslag op de Intelligence Index vertelt niet automatisch hoe een model presteert bij bijvoorbeeld programmeren of cybersecurity.

Mistral kondigde de publieke preview op 6 oktober aan. NeoTeo schreef eerder over de publieke preview van Mistral Large 4.

De Cyber Index laat per test een ander beeld zien

Mistral Large 4 Preview behaalde 50 op de Cyber Index, evenveel als Z.ai GLM-5.3-Flash. De drie resultaten van deeltests liepen echter uiteen: 51% op CWE-Bench-AA, 16% op DeepsecBench-AA en 81,7% op CyberGym-E2E-AA. Die percentages horen bij afzonderlijke tests; ze zijn geen onderdelen die je bij de Cyber Index-score van 50 kunt optellen.

Model en variantCyber Index-scoreCWE-Bench-AADeepsecBench-AACyberGym-E2E-AA
Grok 4.7 (xhigh)5668%27%74%
Xiaomi MiMo-V2.6-Pro5663%26%79%
OpenAI GPT-6 Luna (max)5357%24%78%
Z.ai GLM-5.3-Flash5056%20%74%
Mistral Large 4 Preview5051%16%81,7%

In deze reeks ligt Mistrals CyberGym-E2E-AA-resultaat boven de vier andere getoonde scores, terwijl het model op DeepsecBench-AA juist lager uitkomt. De samengestelde Cyber Index en de uitslag van een afzonderlijke deeltest beantwoorden dus verschillende vragen.

Wat programmeerdemonstraties van makers toevoegen

Engelstalige demonstratie van een Wikipedia-redesign en een LEGO South Park-wereld, met de resultaten op de ranglijsten van de maker
Engelstalige demonstratie van acht KingBench 3-programmeeropdrachten en de gerapporteerde score

Twee makers testten Mistral Large 4 met hun eigen opdrachten. Die demonstraties geven voorbeelden van concrete programmeertaken, maar zijn geen gestandaardiseerde vervanging voor de indexvergelijking.

In de eerste demonstratie behaalde een Wikipedia-redesign de 13e plaats en een LEGO South Park-wereld de 9e op de ranglijsten van de maker. De redesign had volgens die maker een aantrekkelijke vormgeving, maar ook een smalle mobiele indeling en zwakke animatie. In de game waren er problemen met de besturing en de fysica, waaronder voortdurend springen.

Een tweede maker testte acht opdrachten van KingBench 3 met OpenCode via OpenRouter en rapporteerde 42/80 (52,5%), na een correctie voor machtigingen. Een liftsimulatie en een opvouwbare tafel werkten; de standaardruns voor een contactlenshouder en een telopdracht leverden geen bestand of antwoord op. Herhaalpogingen en reparaties telden niet mee in de totaalscore.

De preview en het geplande moment voor de modelgewichten

De benchmarkvergelijking betrof Mistral Large 4 Preview, getest via de API van Mistral. Mistral meldde op 6 oktober dat het van plan was de modelgewichten vóór eind oktober 2026 uit te brengen. Dat was een planning voor de gewichtenpublicatie; de score van 38 hoort bij de previewversie.