Após o lançamento do DeepSeek V4.1 Flash, em setembro, a Bloomberg Intelligence estimou que os modelos chineses líderes estavam 3% atrás dos rivais dos EUA nas pontuações de benchmark. Na mesma sequência, a diferença era de 15% em período anterior do ano e de cerca de 9% em maio.

A sequência da estimativa

Benchmark é um teste usado para comparar o desempenho de modelos. Os percentuais abaixo se referem à diferença estimada nas pontuações dos modelos líderes comparados.

Momento da comparaçãoDiferença estimada nas pontuações de benchmark
Em período anterior do ano15%
Em maioCerca de 9%
Após o lançamento do DeepSeek V4.1 Flash, em setembro3%

A comparação separada da Stanford HAI

Em março de 2026, a Stanford HAI registrou uma vantagem de 2,7% para o principal modelo da Anthropic em sua comparação entre modelos dos EUA e da China. Esse é um resultado de outro período e de uma comparação distinta da sequência da Bloomberg Intelligence.

A Stanford HAI também informou que modelos dos dois países alternaram a liderança várias vezes desde o início de 2025. Em fevereiro daquele ano, o DeepSeek-R1 chegou a igualar brevemente o principal modelo dos EUA.

O que esses percentuais comparam

Os números dizem respeito a pontuações de modelos líderes em comparações de benchmark. Não descrevem todos os modelos chineses e norte-americanos nem o desempenho em cada tarefa do mundo real.

A discussão sobre modelos chineses também inclui os sistemas de pesos abertos, tema de uma reportagem anterior da NeoTeo sobre uma avaliação da Mozilla.