Een scopingreview die PLOS Digital Health op 9 oktober 2026 publiceerde, rapporteert dat GPT-4o en DeepSeek-R1 in een evaluatie van het Chinese artsenexamen uit 2024 boven de gehanteerde slaaggrens scoorden. De review bundelde eerder onderzoek; de resultaten zijn afkomstig uit een schriftelijke toets. Lees de scopingreview in PLOS Digital Health.

De gerapporteerde scores

De review meldt deze puntscores voor de evaluatie:

ModelGerapporteerde score
GPT-4o552 punten (92,00%)
DeepSeek-R1523 punten

De aangehaalde evaluatie gebruikte 600 tekstuele meerkeuzevragen uit het schriftelijke deel van het Chinese National Medical Licensing Examination (CNMLE), het landelijke examen voor artsencertificering. De review hanteerde voor haar synthese een gestandaardiseerde grens van 60% nauwkeurigheid, gebaseerd op het meest gebruikte slaagcriterium in de onderzochte Chinese medische examens.

Een examenuitslag is geen klinische bekwaamheid

Het CNMLE is een route naar certificering als arts in China. De review benadrukt dat prestaties op een examen geen bewijs zijn van klinische bekwaamheid of geschiktheid om zelfstandig geneeskunde te beoefenen. De evaluatie bestond uit schriftelijke meerkeuzevragen; ze beoordeelde geen patiëntenzorg.

De review omvatte 14 studies met 51 evaluatieregistraties over acht typen Chinese medische examens. Tien studies kregen een hoge kwaliteitsbeoordeling en vier een matige, op basis van een checklist met 12 punten. De auteurs merken op dat deze checklist niet formeel is gevalideerd.

De bredere modelvergelijking blijft verkennend

In een verkennende analyse van evaluatieregistraties met slaag- of zakgegevens haalde geen van de 24 GPT-3.5-registraties de drempel; bij GPT-4 waren dat er 9 van de 10. De review rapporteerde voor die vergelijking P < 0,001, maar noemt de uitkomst beschrijvend en geen definitief bewijs van modeloverwicht. De registraties betroffen uiteenlopende examens en testopzetten.

Ook verschilden de studies in examendata, datasets, prompts, modelversies en beoordelingsmethoden. De review stelt bovendien dat mogelijke blootstelling aan openbaar beschikbare examenvragen niet kan worden uitgesloten.