Una revisión de alcance publicada por PLOS Digital Health el 9 de octubre de 2026 recoge que GPT-4o obtuvo 552 puntos (92,00 %) y DeepSeek-R1, 523, en una evaluación del examen nacional chino de habilitación médica de 2024. La revisión describe una prueba de 600 preguntas textuales de opción múltiple de la parte escrita, no una evaluación clínica (PLOS Digital Health).
Las puntuaciones comunicadas
La revisión reunió 14 estudios y 51 registros de evaluación sobre ocho tipos de exámenes médicos chinos. En la evaluación del examen de 2024, las puntuaciones comunicadas fueron:
| Modelo | Puntuación comunicada |
| GPT-4o | 552 puntos (92,00 %) |
| DeepSeek-R1 | 523 puntos |
Una prueba escrita, no una evaluación clínica
El Examen Nacional de Licencia Médica de China es una vía para certificar médicos en el país. En este caso, la evaluación se limitó a preguntas textuales de opción múltiple de la parte escrita; no midió la atención a pacientes.
La revisión estandarizó un umbral del 60 % de aciertos, descrito como el criterio de aprobado más utilizado entre los exámenes incluidos, y señala que ambos resultados lo superaron. Pero una puntuación en un examen no equivale a competencia clínica real ni demuestra que un modelo esté preparado para ejercer medicina de forma autónoma.
Qué permiten concluir las comparaciones
La revisión abarcó estudios sobre exámenes realizados entre 2017 y 2024, con variaciones en las preguntas, las versiones de los modelos, las instrucciones y los métodos de evaluación. También señala que no puede descartarse que algunos modelos hubieran estado expuestos a preguntas disponibles públicamente.
En una comparación exploratoria de registros con datos de aprobado o suspenso, ninguno de los 24 registros de GPT-3.5 alcanzó el umbral, frente a nueve de los 10 registros de GPT-4; la revisión informa de un resultado de P < 0,001. Como los registros procedían de condiciones de evaluación heterogéneas, sus autores presentan el resultado como descriptivo, no como prueba definitiva de superioridad de GPT-4.