Un article publié le 7 octobre 2026 rapporte qu’OpenAI s’appuie sur des centaines de médecins en exercice, engagés comme contractuels à temps partiel, pour évaluer des exemples de conversations de santé avec ChatGPT. Ils repèrent les réponses susceptibles de semer la confusion ou de présenter un risque physique, puis transmettent les lacunes à l’équipe de recherche d’OpenAI.

Des médecins relisent des échanges et signalent les risques

Le réseau décrit couvre 49 langues et comprend des médecins dans des pays comme le Kenya, le Népal et le Brésil. Rebecca Soskin Hicks, qui a rejoint OpenAI en 2024, dirige l’effort décrit.

Les médecins examinent des échanges que pourraient avoir des utilisateurs ou des professionnels de santé avec ChatGPT. Leurs retours portent notamment sur le triage des urgences, les informations manquantes à demander, la façon d’exprimer l’incertitude et le niveau de détail des réponses. Ils transmettent les lacunes repérées aux chercheurs d’OpenAI, sans fournir directement de données d’entraînement.

Un test simulé relève un sous-triage des urgences

Une étude publiée en mai 2026 a évalué ChatGPT Health à l’aide de 60 vignettes cliniques rédigées par des médecins. Le test couvrait 21 domaines médicaux et 16 conditions expérimentales, pour un total de 960 réponses.

Le triage consiste à déterminer le degré d’urgence et le niveau de soins adapté. Dans cette étude, 52 % des cas considérés comme urgents selon le référentiel clinique ont été sous-triés : les recommandations orientaient vers un niveau de soins moins urgent que nécessaire. Parmi les exemples relevés, des cas d’acidocétose diabétique ou d’insuffisance respiratoire imminente ont été orientés vers une évaluation dans les 24 à 48 heures plutôt que vers un service d’urgences.

Dans certains cas limites, une remarque rassurante d’un proche minimisant les symptômes était associée à des recommandations moins urgentes. L’étude rapporte pour cette association un rapport de cotes de 11,7 (intervalle de confiance à 95 % : 3,7–36,6).

La revue et l’étude portent sur des évaluations distinctes

La revue médicale décrite par OpenAI concerne des exemples de conversations et les problèmes repérés dans les réponses. L’étude de mai 2026, elle, mesure des recommandations de triage dans des scénarios simulés. Elle appelle à une validation prospective avant un déploiement du triage par IA à grande échelle auprès du public.

La limite d’usage médical énoncée par OpenAI

Ashley Alexander, responsable des produits de santé d’OpenAI, a déclaré que ChatGPT ne devait pas servir au diagnostic ni au traitement. Le service pourrait aussi proposer d’aider à évaluer des maladies ou des blessures.