Im Vergleich vom 6. Oktober 2026 erzielte Mistral Large 4 Preview im Artificial Analysis Intelligence Index v4.3.2 38 Punkte. Fünf gelistete chinesische Open-Weight-Modelle lagen mit Ergebnissen zwischen 39 und 46 Punkten darüber. Bei den Cybertests zeigte sich ein anderes Profil: Im CyberGym-E2E-AA erreichte die Vorschau 81,7 Prozent.

Mistral Large 4 Preview erzielte 38 Punkte im Vergleich vom 6. Oktober

Der Wert von 38 gehört zum Intelligence Index, einem Vergleichsmaß für die dort geprüften Modelle. An der Spitze der sechs hier gegenübergestellten Varianten lag Xiaomi MiMo-V2.6-Pro mit 46 Punkten; Mistral Large 4 Preview kam auf 38. Das Ergebnis beschreibt die Vorschau in diesem Index, nicht ihre Leistung bei jeder denkbaren Aufgabe.

ModellPunkte im Intelligence Index
Xiaomi MiMo-V2.6-Pro46
Z.ai GLM-5.3 (max)45
Moonshot Kimi K3 (max)44
Z.ai GLM-5.3-Flash42
DeepSeek V4.1 Flash (max)39
Mistral Large 4 Preview38

Die fünf höher platzierten Modelle waren in der aufgeführten Gegenüberstellung als Open-Weight-Modelle gelistet. Der Abstand zwischen Mistral Large 4 Preview und dem höchsten Wert beträgt acht Punkte. Das ist eine Rangfolge innerhalb dieses Indexes, kein allgemeines Urteil über alle Einsatzbereiche.

Cyber Index und Einzeltests zeigen ein anderes Leistungsprofil

Im Cyber Index erreichte Mistral Large 4 Preview 50 Punkte – ebenso wie Z.ai GLM-5.3-Flash. Die drei dazugehörigen Einzeltests ergaben jedoch unterschiedliche Werte: 51 Prozent bei CWE-Bench-AA, 16 Prozent bei DeepsecBench-AA und 81,7 Prozent bei CyberGym-E2E-AA. Der letzte Wert ist das Ergebnis eines Einzeltests, nicht der Gesamtwert des Cyber Index.

Modell und VarianteCyber IndexCWE-Bench-AADeepsecBench-AACyberGym-E2E-AA
Mistral Large 4 Preview5051 %16 %81,7 %
Xiaomi MiMo-V2.6-Pro5663 %26 %79 %
Z.ai GLM-5.3-Flash5056 %20 %74 %
OpenAI GPT-6 Luna (max)5357 %24 %78 %
Grok 4.7 (xhigh)5668 %27 %74 %

Bei CyberGym-E2E-AA lag der Wert von Mistral Large 4 Preview über den Ergebnissen der vier anderen aufgeführten Varianten, die zwischen 74 und 79 Prozent erreichten. In den beiden anderen Einzeltests lag die Vorschau bei 51 beziehungsweise 16 Prozent. Der Blick auf den Gesamtindex allein würde diese Unterschiede zwischen den Einzeltests nicht abbilden.

Was Coding-Demonstrationen zusätzlich zeigen

Englischsprachige Coding-Demo: Eine Wikipedia-Neugestaltung erreichte Platz 13, eine LEGO-South-Park-Spielwelt Platz 9; die Vorführung zeigt auch Schwächen bei Layout, Animation und Spielphysik.
Englischsprachige KingBench-3-Demo: Acht Coding-Aufgaben, 42 von 80 Punkten nach einer Berechtigungskorrektur; Wiederholungs- und Reparaturläufe zählten nicht zur Wertung.

Zwei individuell zusammengestellte Coding-Demos ergänzen die Indexwerte um konkrete Aufgaben. Sie verwenden eigene Tests und Ranglisten und sind kein standardisierter Ersatz für den Indexvergleich.

In einer Demo entstanden eine Neugestaltung einer Wikipedia-Seite und eine LEGO-South-Park-Spielwelt. Die Wikipedia-Aufgabe belegte in der dazugehörigen Rangliste Platz 13, die Spielwelt Platz 9. Beschrieben wurden unter anderem eine schmale, mobil ausgerichtete Seitenansicht und Probleme mit Animation und Spielphysik.

Eine zweite Demo umfasste acht KingBench-3-Aufgaben, die mit OpenCode über OpenRouter bearbeitet wurden. Das Ergebnis nach einer Korrektur der Berechtigungen: 42 von 80 Punkten beziehungsweise 52,5 Prozent. Eine Aufzugssimulation und ein faltbarer Tisch funktionierten; andere Aufgaben blieben ohne Ergebnis oder erforderten erneute Versuche. Wiederholungs- und Reparaturläufe flossen nicht in die Wertung ein.

Vorschau und geplanter Release der Gewichte

Mistral AI stellte Mistral Large 4 am 6. Oktober 2026 als öffentliche Vorschau vor und plante, die Gewichte bis Ende Oktober freizugeben. Der Vergleich bezieht sich auf diese Vorschau. In unserer früheren Meldung zur öffentlichen Vorschau von Mistral Large 4 ging es um den Start des Modells.