Après la sortie de DeepSeek V4.1 Flash en septembre 2026, Bloomberg Intelligence a estimé à 3 % l’écart entre les scores de benchmark des modèles chinois de pointe et ceux de leurs rivaux américains. Dans la même série, cet écart était estimé à 15 % plus tôt dans l’année et à environ 9 % en mai.
L’écart rapporté après DeepSeek V4.1 Flash
Un benchmark est un test conçu pour comparer les performances de modèles sur des tâches définies. Le chiffre de 3 % concerne les scores des modèles de pointe dans la comparaison de Bloomberg Intelligence. Il ne décrit pas la performance de chaque modèle dans tous les usages.
Trois repères dans la même estimation
La série de Bloomberg Intelligence situe l’écart entre les modèles chinois et américains à trois moments :
| Moment de la comparaison | Écart estimé entre les scores |
| Plus tôt en 2026 | 15 % |
| Mai 2026 | Environ 9 % |
| Après la sortie de DeepSeek V4.1 Flash, en septembre 2026 | 3 % |
Stanford HAI : une comparaison distincte
NeoTeo avait déjà consacré un article à l’évaluation de Mozilla sur les modèles chinois à poids ouverts. Le résultat de Stanford HAI porte, lui, sur une comparaison États-Unis–Chine datée de mars 2026 : le modèle de pointe d’Anthropic y devançait les modèles chinois de 2,7 %.
Stanford HAI indique également que les modèles américains et chinois se sont échangé la tête à plusieurs reprises depuis le début de 2025.