Una revisión de alcance publicada por PLOS Digital Health el 9 de octubre de 2026 recoge que GPT-4o obtuvo 552 puntos (92,00 %) y DeepSeek-R1, 523, en una evaluación del examen nacional chino de habilitación médica de 2024. La revisión describe una prueba de 600 preguntas textuales de opción múltiple de la parte escrita, no una evaluación clínica (PLOS Digital Health).

Las puntuaciones comunicadas

La revisión reunió 14 estudios y 51 registros de evaluación sobre ocho tipos de exámenes médicos chinos. En la evaluación del examen de 2024, las puntuaciones comunicadas fueron:

ModeloPuntuación comunicada
GPT-4o552 puntos (92,00 %)
DeepSeek-R1523 puntos

Una prueba escrita, no una evaluación clínica

El Examen Nacional de Licencia Médica de China es una vía para certificar médicos en el país. En este caso, la evaluación se limitó a preguntas textuales de opción múltiple de la parte escrita; no midió la atención a pacientes.

La revisión estandarizó un umbral del 60 % de aciertos, descrito como el criterio de aprobado más utilizado entre los exámenes incluidos, y señala que ambos resultados lo superaron. Pero una puntuación en un examen no equivale a competencia clínica real ni demuestra que un modelo esté preparado para ejercer medicina de forma autónoma.

Qué permiten concluir las comparaciones

La revisión abarcó estudios sobre exámenes realizados entre 2017 y 2024, con variaciones en las preguntas, las versiones de los modelos, las instrucciones y los métodos de evaluación. También señala que no puede descartarse que algunos modelos hubieran estado expuestos a preguntas disponibles públicamente.

En una comparación exploratoria de registros con datos de aprobado o suspenso, ninguno de los 24 registros de GPT-3.5 alcanzó el umbral, frente a nueve de los 10 registros de GPT-4; la revisión informa de un resultado de P < 0,001. Como los registros procedían de condiciones de evaluación heterogéneas, sus autores presentan el resultado como descriptivo, no como prueba definitiva de superioridad de GPT-4.