Após o lançamento do DeepSeek V4.1 Flash, em setembro, a Bloomberg Intelligence estimou que os modelos chineses líderes estavam 3% atrás dos rivais dos EUA nas pontuações de benchmark. Na mesma sequência, a diferença era de 15% em período anterior do ano e de cerca de 9% em maio.
A sequência da estimativa
Benchmark é um teste usado para comparar o desempenho de modelos. Os percentuais abaixo se referem à diferença estimada nas pontuações dos modelos líderes comparados.
| Momento da comparação | Diferença estimada nas pontuações de benchmark |
| Em período anterior do ano | 15% |
| Em maio | Cerca de 9% |
| Após o lançamento do DeepSeek V4.1 Flash, em setembro | 3% |
A comparação separada da Stanford HAI
Em março de 2026, a Stanford HAI registrou uma vantagem de 2,7% para o principal modelo da Anthropic em sua comparação entre modelos dos EUA e da China. Esse é um resultado de outro período e de uma comparação distinta da sequência da Bloomberg Intelligence.
A Stanford HAI também informou que modelos dos dois países alternaram a liderança várias vezes desde o início de 2025. Em fevereiro daquele ano, o DeepSeek-R1 chegou a igualar brevemente o principal modelo dos EUA.
O que esses percentuais comparam
Os números dizem respeito a pontuações de modelos líderes em comparações de benchmark. Não descrevem todos os modelos chineses e norte-americanos nem o desempenho em cada tarefa do mundo real.
A discussão sobre modelos chineses também inclui os sistemas de pesos abertos, tema de uma reportagem anterior da NeoTeo sobre uma avaliação da Mozilla.