Una revisione di mappatura pubblicata il 9 ottobre 2026 su PLOS Digital Health riferisce che GPT-4o ha ottenuto 552 punti, pari al 92,00%, e DeepSeek-R1 523 punti nell’esame nazionale cinese per l’abilitazione medica del 2024. I risultati riguardano una prova scritta a scelta multipla: non misurano la capacità dei modelli di curare pazienti. La revisione di PLOS Digital Health ha sintetizzato valutazioni precedenti, senza svolgere un nuovo esame.
| Modello | Punti riportati |
| GPT-4o | 552 |
| DeepSeek-R1 | 523 |
Che cosa misurava la prova
La valutazione del 2024 descritta dalla revisione comprendeva 600 domande testuali a scelta multipla della parte scritta dell’esame. Il China National Medical Licensing Examination è un esame legato alla certificazione dei medici in Cina; il test citato, però, non era una valutazione delle prestazioni in ambito clinico.
Nella sua sintesi, la revisione ha standardizzato al 60% la soglia di superamento comunemente utilizzata per il CNMLE e per gli altri esami medici cinesi inclusi. I punteggi riportati per entrambi i modelli superavano quel criterio. La soglia è il riferimento adottato dalla revisione per confrontare gli studi, non una garanzia di abilitazione per un modello.
Un punteggio d’esame non equivale alla competenza clinica
La revisione distingue esplicitamente la prestazione in un esame standardizzato dalla capacità di esercitare la medicina: superare un test scritto non dimostra competenza clinica nel mondo reale né preparazione alla pratica autonoma. Le domande a scelta multipla misurano il risultato in quel formato e in quelle condizioni; non stabiliscono come un modello si comporterebbe nella cura di una persona.
Che cosa dice il quadro più ampio
La revisione ha raccolto 14 studi, 51 valutazioni e otto categorie di esami medici cinesi. Il CNMLE rappresentava 32 valutazioni in 11 pubblicazioni. I lavori esaminati differivano per anno d’esame, selezione delle domande, prompt, versioni dei modelli, modalità di accesso e criteri di valutazione. Gli autori segnalano inoltre che non si può escludere una possibile esposizione dei modelli a domande d’esame pubblicate online.
Un confronto esplorativo sulle valutazioni con esito di superamento disponibile ha rilevato che nessuna delle 24 prove di GPT-3.5 raggiungeva la soglia, mentre lo facevano 9 delle 10 prove di GPT-4; la revisione riporta P < 0,001. Gli autori descrivono il risultato come indicativo, non come prova definitiva della superiorità di un modello: i dati provengono da esami e condizioni di valutazione eterogenei.
Per valutare la qualità degli studi, la revisione ha usato una lista di controllo personalizzata di 12 criteri: 10 studi sono stati classificati di qualità alta e quattro moderata. Gli autori precisano che la lista non è stata convalidata formalmente, quindi le valutazioni sono indicative. In un singolo studio incluso, GPT-4 ha ottenuto l’84% sull’esame originale in cinese e l’86% sulla versione tradotta in inglese: un risultato circoscritto a quel confronto, non una regola generale sulle prestazioni linguistiche dei modelli.