Volgens een op 7 oktober 2026 gepubliceerd verslag zet OpenAI honderden artsen als deeltijdcontractant in om voorbeeldgesprekken over gezondheid met ChatGPT te beoordelen. De artsen signaleren verwarrende of mogelijk schadelijke antwoorden en geven gevonden tekortkomingen door aan het onderzoeksteam van OpenAI.

Wat artsen beoordelen en hoe hun feedback wordt gebruikt

De artsen bekijken voorbeelden van gesprekken die gebruikers of zorgverleners met ChatGPT kunnen voeren. Ze letten op antwoorden die verwarring kunnen veroorzaken of lichamelijk gevaar kunnen opleveren. Volgens het verslag leveren de artsen niet rechtstreeks trainingsdata aan: ze brengen problemen onder de aandacht van het onderzoeksteam, dat ermee verder kan werken.

Het netwerk bestaat volgens het verslag uit honderden praktiserende artsen die samen 49 talen spreken. De beschreven aandachtspunten zijn onder meer spoedtriage — bepalen hoe dringend iemand zorg nodig heeft —, ontbrekende informatie uitvragen, onzekerheid duidelijk maken en het juiste detailniveau kiezen.

Een test vond ondertriage bij gesimuleerde spoedgevallen

Een afzonderlijke studie, gepubliceerd in mei 2026, testte ChatGPT Health met 60 door clinici geschreven casussen uit 21 medische domeinen. De onderzoekers genereerden 960 antwoorden onder 16 testcondities.

Bij 52% van de referentiegevallen die als spoedgeval waren aangemerkt, schatte ChatGPT Health de urgentie te laag in. Dat is ondertriage: een situatie waarin het advies niet aangeeft dat iemand zo dringend zorg nodig heeft als de klinische referentie voorschrijft. De test gebruikte gesimuleerde casussen; de onderzoekers pleitten voor prospectieve validatie voordat AI-triage op consumentenschaal wordt ingezet.

De studie beschreef ook randgevallen waarin geruststellende opmerkingen van een vriend of familielid aanbevelingen naar minder urgente zorg konden verschuiven. De gerapporteerde oddsratio was 11,7 (95%-betrouwbaarheidsinterval: 3,7–36,6).

Wat de beoordeling en de test zeggen over veiligheid

De artsenreview is een proces om antwoorden te beoordelen en tekortkomingen aan onderzoekers door te geven. Het meet niet of patiënten daardoor betere gezondheidsuitkomsten krijgen. De aparte studie keek naar de triageadviezen van ChatGPT Health in gesimuleerde scenario’s. Die bevindingen beschrijven dus niet hoe vaak ondertriage voorkomt in gewone gesprekken of bij elke versie van ChatGPT.

De twee werkzaamheden hebben verschillende doelen: artsen geven OpenAI feedback op voorbeeldgesprekken, terwijl de studie de triageprestaties van ChatGPT Health in een gestructureerde test beoordeelde.

OpenAI’s grens voor medisch gebruik

Ashley Alexander, hoofd gezondheidsproducten bij OpenAI, zei dat ChatGPT niet voor diagnose en behandeling gebruikt moet worden.