4 października pojawił się szacunek Bloomberg Intelligence, według którego po wrześniowym wydaniu DeepSeek V4.1 Flash różnica między wynikami benchmarków czołowych modeli z Chin i USA wynosiła 3%. Benchmark to test pozwalający porównywać modele na podstawie wyników określonych zadań.
Szacunek po wydaniu DeepSeek V4.1 Flash
Podawane 3% dotyczyło różnicy wyników czołowych modeli chińskich i amerykańskich. To szacunek odnoszący się do benchmarków, nie ocena każdego modelu ani każdej pracy wykonywanej z pomocą AI.
Jak zmieniała się różnica w tej samej serii
W serii szacunków Bloomberg Intelligence różnica wynosiła 15% wcześniej w 2026 r., około 9% w maju i 3% po wrześniowym wydaniu DeepSeek V4.1 Flash.
| Moment porównania | Szacowana różnica wyników benchmarków |
| Wcześniej w 2026 r. | 15% |
| Maj 2026 r. | Około 9% |
| Po wrześniowym wydaniu DeepSeek V4.1 Flash | 3% |
Odrębne porównanie Stanford HAI
W porównaniu Stanford HAI dotyczącym marca 2026 r. czołowy model Anthropic miał przewagę 2,7% nad chińskimi modelami. To osobny wynik z wcześniejszego okresu. Stanford HAI podawał też, że modele z USA i Chin wielokrotnie wymieniały się prowadzeniem od początku 2025 r.
Wcześniej NeoTeo opisywało ocenę Mozilli dotyczącą chińskich modeli z otwartymi wagami — to inny aspekt rywalizacji niż porównanie wyników czołowych modeli.
Co mówi różnica w wynikach
Odsetek opisuje dystans między wynikami czołówki w danym porównaniu. Przy wyborze modelu liczy się jednak konkretne zadanie i konkretny system: wynik benchmarku nie przesądza, który model lepiej sprawdzi się w każdym zastosowaniu.