Eine am 9. Oktober 2026 in PLOS Digital Health veröffentlichte Übersichtsarbeit berichtet, dass GPT-4o und DeepSeek-R1 bei der schriftlichen chinesischen Zulassungsprüfung von 2024 den zugrunde gelegten Bestehensmaßstab übertrafen. Die Ergebnisse stammen aus einem schriftlichen Wissenstest; sie belegen keine klinische Kompetenz. Die Übersichtsarbeit fasst frühere Auswertungen zusammen.
Welche Punktzahlen die Übersicht nennt
| Modell | Berichtetes Ergebnis |
| GPT-4o | 552 Punkte (92,00 %) |
| DeepSeek-R1 | 523 Punkte |
600 schriftliche Fragen statt einer klinischen Prüfung
Die ausgewertete Untersuchung umfasste laut Übersicht 600 textbasierte Multiple-Choice-Fragen aus dem schriftlichen Teil der Prüfung. Die chinesische Nationale Prüfung zur ärztlichen Zulassung (CNMLE) dient der Zertifizierung von Ärztinnen und Ärzten. Der Vergleich prüfte jedoch keine Versorgung von Patientinnen und Patienten.
Für ihre Zusammenfassung legte die Übersichtsarbeit eine Trefferquote von 60 Prozent als einheitlichen, bei der CNMLE und verwandten chinesischen Prüfungen am häufigsten verwendeten Bestehensmaßstab zugrunde. Beide berichteten Ergebnisse lagen darüber. Die Autorinnen und Autoren betonen zugleich, dass eine Prüfungsleistung keine klinische Kompetenz und keine Bereitschaft zur eigenständigen ärztlichen Tätigkeit nachweist.
Was die breitere Studienlage hergibt
Die Übersicht bündelte 14 begutachtete Studien mit 51 Auswertungseinträgen zu acht Arten chinesischer medizinischer Prüfungen. Die CNMLE machte 32 dieser Einträge aus. Die Untersuchungen unterschieden sich unter anderem bei Prüfungsjahren, Datensätzen, Modellversionen, Prompts und Bewertungsverfahren; eine mögliche Vertrautheit mit öffentlich zugänglichen Prüfungsfragen ließ sich laut Übersicht nicht ausschließen.
Ein explorativer Vergleich von Auswertungseinträgen mit bekannten Bestehensresultaten ergab für GPT-3.5 null bestandene Fälle von 24 und für GPT-4 neun von zehn. Die Übersicht nennt dafür P < 0,001, stuft den Vergleich wegen der unterschiedlichen Prüfungs- und Testbedingungen aber als beschreibend ein; einen allgemeinen Überlegenheitsnachweis sieht sie darin nicht. Eine eigens entwickelte Checkliste bewertete zehn der 14 Studien als qualitativ hochwertig und vier als mittelmäßig. Die Checkliste wurde nach Angaben der Autorinnen und Autoren nicht formal validiert.