Na comparação de benchmarks de 6 de outubro de 2026, Mistral Large 4 Preview marcou 38 no Artificial Analysis Intelligence Index v4.3.2. Cinco modelos chineses open-weight listados ficaram acima, entre 39 e 46. No Cyber Index, o modelo marcou 50, com resultados diferentes nos três testes componentes.

Mistral Large 4 Preview marcou 38 na comparação de 6 de outubro

O resultado de 38 pertence ao Intelligence Index, uma medida distinta das pontuações dos testes de cibersegurança. Entre as seis variantes comparadas na tabela, Xiaomi MiMo-V2.6-Pro liderou com 46, enquanto Mistral Large 4 Preview ficou com 38.

As pontuações do Intelligence Index

ModeloPontuação
Xiaomi MiMo-V2.6-Pro46
Z.ai GLM-5.3 (max)45
Moonshot Kimi K3 (max)44
Z.ai GLM-5.3-Flash42
DeepSeek V4.1 Flash (max)39
Mistral Large 4 Preview38

Os cinco modelos chineses open-weight listados marcaram de 39 a 46; o modelo da Mistral ficou oito pontos abaixo do MiMo-V2.6-Pro. A ordem vale para esse índice e para as variantes comparadas: os resultados de cibersegurança medem outros testes e formam um quadro diferente.

O Cyber Index mostra resultados diferentes conforme o teste

Mistral Large 4 Preview marcou 50 no Cyber Index, a mesma pontuação de Z.ai GLM-5.3-Flash. Nos testes componentes, registrou 51% no CWE-Bench-AA, 16% no DeepsecBench-AA e 81,7% no CyberGym-E2E-AA.

Modelo e varianteCyber IndexCWE-Bench-AADeepsecBench-AACyberGym-E2E-AA
Grok 4.7 (xhigh)5668%27%74%
Xiaomi MiMo-V2.6-Pro5663%26%79%
OpenAI GPT-6 Luna (max)5357%24%78%
Z.ai GLM-5.3-Flash5056%20%74%
Mistral Large 4 Preview5051%16%81,7%

O resultado de 81,7% no CyberGym-E2E-AA foi o maior entre esses cinco modelos. Já no DeepsecBench-AA, Mistral Large 4 Preview registrou 16%. O agregado do Cyber Index, por sua vez, empatou com Z.ai GLM-5.3-Flash e ficou abaixo dos 53 pontos de OpenAI GPT-6 Luna (max) e dos 56 de Grok 4.7 (xhigh) e Xiaomi MiMo-V2.6-Pro.

O que as demonstrações de programação mostram

Demonstração em inglês de duas tarefas próprias: redesign da Wikipédia e um mundo de LEGO South Park, com resultados e problemas apresentados pelo criador.
Vídeo em inglês com oito tarefas KingBench 3, protótipos funcionais, falhas e a pontuação final de 42/80 (52,5%).

Duas demonstrações em inglês acrescentam tarefas práticas, com placares próprios, à comparação de índices. Elas não são avaliações padronizadas equivalentes ao Intelligence Index.

Em uma delas, o criador testou um redesign de uma página da Wikipédia e um mundo de LEGO South Park. O redesign ficou em 13º lugar no placar da tarefa; o jogo, em 9º. A demonstração também mostra um layout estreito e animações insatisfatórias no redesign, além de problemas de controle e física no jogo.

Outra demonstração avaliou oito tarefas KingBench 3 usando OpenCode por meio do OpenRouter. O resultado informado foi de 42/80 (52,5%), após correção das permissões; novas tentativas e reparos ficaram fora da pontuação. Entre os resultados, houve uma simulação de elevador e uma mesa dobrável em Three.js que funcionaram, além de tarefas que falharam ou precisaram de novas tentativas.

A versão Preview e o plano para publicar os pesos

A comparação avaliou Mistral Large 4 Preview, apresentada como prévia pública em 6 de outubro de 2026. A cobertura anterior da NeoTeo sobre a abertura da prévia trata desse acesso; esta análise se concentra nos resultados dos benchmarks.

A Mistral planejava publicar os pesos do modelo até o fim de outubro de 2026.