OpenAI lässt laut einem am 7. Oktober 2026 veröffentlichten Bericht Gesundheitsdialoge von ChatGPT von Hunderten Ärztinnen und Ärzten prüfen. Sie markieren verwirrende oder potenziell gefährliche Antworten und melden erkannte Leistungslücken an OpenAIs Forschungsteam. Eine separate, im Mai 2026 veröffentlichte Studie fand in einem strukturierten Test, dass ChatGPT Health 52 Prozent der Goldstandard-Notfälle untertriagierte – also die Dringlichkeit zu niedrig einstufte.

Was die Ärzte prüfen und wie ihr Feedback weitergeht

Die Ärztinnen und Ärzte arbeiten laut Bericht auf Teilzeitbasis für OpenAI und decken 49 Sprachen ab. Sie beurteilen Beispielgespräche, wie sie Nutzerinnen, Nutzer oder medizinisches Fachpersonal mit ChatGPT führen könnten. Im Mittelpunkt stehen Antworten, die Menschen verwirren oder körperliche Gefahr bergen könnten.

Die Ärztinnen und Ärzte leiten erkannte Schwächen an OpenAIs Forschungsteam weiter. Sie liefern dem Bericht zufolge nicht direkt Trainingsdaten. Zu den genannten Entwicklungszielen zählen eine bessere Einschätzung von Notfällen, gezielte Rückfragen bei fehlenden Angaben, eine klarere Kommunikation von Unsicherheit und eine passende Antwortlänge.

Eine separate Studie testete ChatGPT Health in Notfallsimulationen

Die im Mai 2026 veröffentlichte Studie untersuchte ChatGPT Health anhand von 60 klinischen Fallbeschreibungen aus 21 Fachgebieten. Unter 16 Testbedingungen entstanden insgesamt 960 Antworten. In 52 Prozent der Fälle, die nach klinischem Goldstandard als Notfälle galten, stufte ChatGPT Health die Dringlichkeit zu niedrig ein.

Zu den Fehlbewertungen gehörten simulierte Fälle mit diabetischer Ketoazidose und drohendem Atemversagen. Für sie empfahl ChatGPT Health eine Abklärung innerhalb von 24 bis 48 Stunden statt einer Vorstellung in der Notaufnahme.

Auch die Schilderung durch andere Personen konnte eine Rolle spielen: Wenn Freunde oder Angehörige Beschwerden verharmlosten, verschoben sich Empfehlungen in Grenzfällen meist in Richtung weniger dringender Versorgung. Für diesen Zusammenhang wurde ein Odds Ratio von 11,7 berichtet; das 95-Prozent-Konfidenzintervall lag bei 3,7 bis 36,6.

Was Prüfprozess und Studie über die Sicherheit aussagen

Die ärztliche Prüfung ist ein Rückmeldeprozess für die Produktentwicklung: Fachleute markieren problematische Beispielantworten und leiten die Lücken an das Forschungsteam weiter. Die separate Studie bewertete dagegen Empfehlungen für simulierte Fälle; sie untersuchte keine Behandlungsergebnisse realer Patienten. Die beiden Verfahren beschreiben also unterschiedliche Aspekte der Bewertung von Gesundheitsantworten.

OpenAI zieht eine Grenze bei Diagnose und Behandlung

ChatGPT kann laut Bericht anbieten, bei der Einschätzung von Krankheiten und Verletzungen zu helfen. Ashley Alexander, OpenAIs Leiterin für Gesundheitsprodukte, sagte, ChatGPT solle nicht zur Diagnose oder Behandlung verwendet werden.