Przegląd opublikowany 9 października 2026 r. w „PLOS Digital Health” podał, że GPT-4o i DeepSeek-R1 przekroczyły opisywany w nim próg zaliczenia chińskiego egzaminu licencyjnego dla lekarzy z 2024 r. Wyniki pochodzą z wcześniejszej ewaluacji pisemnej, a nie z nowego egzaminu przeprowadzonego przez autorów przeglądu.

Jakie wyniki uzyskały modele?

Przegląd podaje następujące wyniki punktowe dla GPT-4o i DeepSeek-R1:

ModelWynik punktowy
GPT-4o552 punkty
DeepSeek-R1523 punkty

Dla GPT-4o przegląd podał także wynik 92,00%. Opisana ewaluacja obejmowała 600 tekstowych pytań wielokrotnego wyboru z pisemnej części chińskiego krajowego egzaminu licencyjnego dla lekarzy (Chinese National Medical Licensing Examination, CNMLE). Nie była to ocena pracy z pacjentami.

Przegląd ustandaryzował próg 60% poprawnych odpowiedzi jako najczęściej stosowane kryterium zaliczenia w uwzględnionych chińskich egzaminach medycznych. To opis kryterium używanego w analizowanych badaniach, a nie potwierdzenie oficjalnego progu obowiązującego w każdej sesji CNMLE.

Wynik egzaminu nie jest kompetencją kliniczną

CNMLE jest egzaminem związanym z certyfikacją lekarzy w Chinach. Wyniki modeli w jego pisemnej części nie oznaczają uzyskania uprawnień lekarskich i nie dowodzą gotowości do samodzielnej praktyki. Autorzy przeglądu podkreślają, że rezultat testu nie wykazuje, czy model potrafi skutecznie diagnozować lub leczyć pacjentów.

Jak mocne jest szersze porównanie modeli?

Przegląd objął 14 badań, 51 rekordów ewaluacji i osiem rodzajów chińskich egzaminów medycznych. W dodatkowym, eksploracyjnym zestawieniu rekordów z danymi o zaliczeniu progu żaden z 24 rekordów GPT-3.5 nie osiągnął wyniku zaliczającego; zrobiło to 9 z 10 rekordów GPT-4. Autorzy podali p < 0,001, ale zaznaczyli, że porównanie ma charakter opisowy, a nie rozstrzygający: badania różniły się egzaminami, zestawami pytań, wersjami modeli, promptami i sposobami oceny.

Jakość 14 badań oceniono przy użyciu autorskiej listy kontrolnej złożonej z 12 punktów: 10 otrzymało ocenę wysoką, a cztery umiarkowaną. Autorzy zaznaczyli, że lista nie przeszła formalnej walidacji, więc oceny mają charakter orientacyjny. Wskazali też, że niektóre badania nie opisywały konsekwentnie roku egzaminu, dostępności danych ani użytych promptów. Możliwego wpływu publicznie dostępnych pytań na wyniki nie da się wykluczyć.