La revue de portée publiée par PLOS Digital Health le 9 octobre 2026 rapporte que GPT-4o et DeepSeek-R1 ont dépassé le seuil de réussite retenu dans son analyse du CNMLE 2024, l’examen chinois de certification des médecins. L’évaluation portait sur 600 questions écrites à choix multiple, uniquement textuelles — pas sur une épreuve clinique. La revue de PLOS Digital Health synthétise des évaluations antérieures ; ses auteurs n’ont pas organisé un nouvel examen.

Les scores rapportés pour l’examen chinois

ModèleScore rapporté
GPT-4o552 points
DeepSeek-R1523 points

La revue associe au résultat de GPT-4o un taux de 92,00 %. Elle indique que les deux modèles ont dépassé le seuil de 60 % qu’elle a standardisé comme critère de réussite couramment utilisé dans les examens inclus. Ce seuil décrit la méthode de synthèse de la revue, et non une valeur officielle vérifiée pour chaque session du CNMLE.

La synthèse couvre 14 études, 51 évaluations et huit types d’examens médicaux chinois. Les examens étudiés dataient de 2017 à 2024 ; l’évaluation du CNMLE 2024 est la plus récente de la revue. Le CNMLE est un examen lié à la certification des médecins en Chine.

Un résultat écrit ne mesure pas l’aptitude à soigner

Réussir des questions à choix multiple ne suffit pas à établir qu’un modèle sait prendre en charge des patients. La revue précise que la performance à un examen ne démontre ni compétence clinique réelle ni aptitude à exercer de manière autonome. Les scores rapportés sont ceux d’un test écrit et textuel, pas d’une évaluation de la pratique médicale.

La revue a évalué la qualité des études à l’aide d’une grille personnalisée de 12 critères : dix études ont été classées de qualité élevée et quatre de qualité modérée. Ses auteurs précisent que cette grille n’a pas été formellement validée ; ces appréciations restent donc indicatives.

Les comparaisons entre modèles restent exploratoires

Dans une comparaison exploratoire des évaluations disposant de résultats de réussite ou d’échec, aucune des 24 évaluations de GPT-3.5 n’a atteint le seuil, contre neuf sur dix pour GPT-4. La revue rapporte une valeur de P < 0,001, mais décrit cette comparaison comme descriptive, pas comme une preuve définitive de supériorité : les examens, les jeux de questions, les versions des modèles, les consignes et les méthodes de notation variaient d’une étude à l’autre.

La revue ajoute que l’exposition possible à des questions publiées en ligne ne permet pas d’écarter une contamination ou une mémorisation des questions. Cette réserve, comme l’hétérogénéité des évaluations, limite ce que les scores permettent de conclure sur les capacités des modèles au-delà de ces tests.