4 października pojawił się szacunek Bloomberg Intelligence, według którego po wrześniowym wydaniu DeepSeek V4.1 Flash różnica między wynikami benchmarków czołowych modeli z Chin i USA wynosiła 3%. Benchmark to test pozwalający porównywać modele na podstawie wyników określonych zadań.

Szacunek po wydaniu DeepSeek V4.1 Flash

Podawane 3% dotyczyło różnicy wyników czołowych modeli chińskich i amerykańskich. To szacunek odnoszący się do benchmarków, nie ocena każdego modelu ani każdej pracy wykonywanej z pomocą AI.

Jak zmieniała się różnica w tej samej serii

W serii szacunków Bloomberg Intelligence różnica wynosiła 15% wcześniej w 2026 r., około 9% w maju i 3% po wrześniowym wydaniu DeepSeek V4.1 Flash.

Moment porównaniaSzacowana różnica wyników benchmarków
Wcześniej w 2026 r.15%
Maj 2026 r.Około 9%
Po wrześniowym wydaniu DeepSeek V4.1 Flash3%

Odrębne porównanie Stanford HAI

W porównaniu Stanford HAI dotyczącym marca 2026 r. czołowy model Anthropic miał przewagę 2,7% nad chińskimi modelami. To osobny wynik z wcześniejszego okresu. Stanford HAI podawał też, że modele z USA i Chin wielokrotnie wymieniały się prowadzeniem od początku 2025 r.

Wcześniej NeoTeo opisywało ocenę Mozilli dotyczącą chińskich modeli z otwartymi wagami — to inny aspekt rywalizacji niż porównanie wyników czołowych modeli.

Co mówi różnica w wynikach

Odsetek opisuje dystans między wynikami czołówki w danym porównaniu. Przy wyborze modelu liczy się jednak konkretne zadanie i konkretny system: wynik benchmarku nie przesądza, który model lepiej sprawdzi się w każdym zastosowaniu.