A revisão publicada em 9 de outubro de 2026 relata que GPT-4o e DeepSeek-R1 superaram o critério de aprovação que ela padronizou para a avaliação do Exame Nacional de Licenciamento Médico da China (CNMLE), referente a 2024. Os resultados vieram de 600 questões textuais de múltipla escolha da parte escrita — não de uma avaliação clínica —, segundo a revisão da PLOS Digital Health.

As pontuações relatadas

ModeloPontuação relatada
GPT-4o552 pontos (92,00%)
DeepSeek-R1523 pontos

A revisão descreve 60% de acerto como o critério de aprovação mais comum entre os exames chineses incluídos e o padroniza na análise. Não se trata de uma confirmação de que esse seja o corte oficial de todas as edições do CNMLE.

O que a prova avaliou — e o que não avaliou

O CNMLE é uma via de certificação de médicos na China. A comparação de 2024, porém, usou questões escritas de múltipla escolha, sem componentes visuais. O desempenho nessa prova não demonstra competência clínica no atendimento real nem prontidão para a prática médica autônoma.

A revisão de escopo reuniu 14 estudos, 51 registros de avaliação e oito tipos de exames médicos chineses; 11 publicações e 32 registros tratavam do CNMLE. As avaliações abrangeram exames de 2017 a 2024, com diferenças entre conjuntos de questões, versões de modelos, prompts, formas de acesso e métodos de pontuação. A revisão também observa que não é possível descartar a exposição prévia dos modelos a questões publicadas na internet.

Na avaliação da qualidade, uma lista própria de 12 itens classificou dez estudos como de alta qualidade e quatro como de qualidade moderada. Como essa lista não passou por validação formal, as classificações são indicativas.

Uma comparação entre registros, não um duelo controlado

Em uma análise exploratória de registros com resultados de aprovação ou reprovação, nenhum dos 24 registros de GPT-3.5 atingiu o critério, enquanto nove dos dez registros de GPT-4 o fizeram. A revisão relata P < 0,001 no teste estatístico, mas trata o resultado como descritivo: as condições variadas entre os estudos não permitem concluir que um modelo tenha superioridade definitiva.