Een scopingreview die PLOS Digital Health op 9 oktober 2026 publiceerde, rapporteert dat GPT-4o en DeepSeek-R1 in een evaluatie van het Chinese artsenexamen uit 2024 boven de gehanteerde slaaggrens scoorden. De review bundelde eerder onderzoek; de resultaten zijn afkomstig uit een schriftelijke toets. Lees de scopingreview in PLOS Digital Health.
De gerapporteerde scores
De review meldt deze puntscores voor de evaluatie:
| Model | Gerapporteerde score |
| GPT-4o | 552 punten (92,00%) |
| DeepSeek-R1 | 523 punten |
De aangehaalde evaluatie gebruikte 600 tekstuele meerkeuzevragen uit het schriftelijke deel van het Chinese National Medical Licensing Examination (CNMLE), het landelijke examen voor artsencertificering. De review hanteerde voor haar synthese een gestandaardiseerde grens van 60% nauwkeurigheid, gebaseerd op het meest gebruikte slaagcriterium in de onderzochte Chinese medische examens.
Een examenuitslag is geen klinische bekwaamheid
Het CNMLE is een route naar certificering als arts in China. De review benadrukt dat prestaties op een examen geen bewijs zijn van klinische bekwaamheid of geschiktheid om zelfstandig geneeskunde te beoefenen. De evaluatie bestond uit schriftelijke meerkeuzevragen; ze beoordeelde geen patiëntenzorg.
De review omvatte 14 studies met 51 evaluatieregistraties over acht typen Chinese medische examens. Tien studies kregen een hoge kwaliteitsbeoordeling en vier een matige, op basis van een checklist met 12 punten. De auteurs merken op dat deze checklist niet formeel is gevalideerd.
De bredere modelvergelijking blijft verkennend
In een verkennende analyse van evaluatieregistraties met slaag- of zakgegevens haalde geen van de 24 GPT-3.5-registraties de drempel; bij GPT-4 waren dat er 9 van de 10. De review rapporteerde voor die vergelijking P < 0,001, maar noemt de uitkomst beschrijvend en geen definitief bewijs van modeloverwicht. De registraties betroffen uiteenlopende examens en testopzetten.
Ook verschilden de studies in examendata, datasets, prompts, modelversies en beoordelingsmethoden. De review stelt bovendien dat mogelijke blootstelling aan openbaar beschikbare examenvragen niet kan worden uitgesloten.