Après la sortie de DeepSeek V4.1 Flash en septembre 2026, Bloomberg Intelligence a estimé à 3 % l’écart entre les scores de benchmark des modèles chinois de pointe et ceux de leurs rivaux américains. Dans la même série, cet écart était estimé à 15 % plus tôt dans l’année et à environ 9 % en mai.

L’écart rapporté après DeepSeek V4.1 Flash

Un benchmark est un test conçu pour comparer les performances de modèles sur des tâches définies. Le chiffre de 3 % concerne les scores des modèles de pointe dans la comparaison de Bloomberg Intelligence. Il ne décrit pas la performance de chaque modèle dans tous les usages.

Trois repères dans la même estimation

La série de Bloomberg Intelligence situe l’écart entre les modèles chinois et américains à trois moments :

Moment de la comparaisonÉcart estimé entre les scores
Plus tôt en 202615 %
Mai 2026Environ 9 %
Après la sortie de DeepSeek V4.1 Flash, en septembre 20263 %

Stanford HAI : une comparaison distincte

NeoTeo avait déjà consacré un article à l’évaluation de Mozilla sur les modèles chinois à poids ouverts. Le résultat de Stanford HAI porte, lui, sur une comparaison États-Unis–Chine datée de mars 2026 : le modèle de pointe d’Anthropic y devançait les modèles chinois de 2,7 %.

Stanford HAI indique également que les modèles américains et chinois se sont échangé la tête à plusieurs reprises depuis le début de 2025.