Un resoconto pubblicato il 7 ottobre 2026 riferisce che OpenAI si avvale di centinaia di medici a contratto part-time per esaminare esempi di conversazioni sanitarie con ChatGPT. I medici individuano risposte che possono confondere o comportare rischi fisici e trasmettono le lacune al team di ricerca. La rete comprende professionisti che parlano 49 lingue.

Come funziona la revisione medica

I medici valutano esempi di conversazioni che potrebbero avere con ChatGPT sia gli utenti sia i professionisti sanitari. Segnalano risposte poco chiare o potenzialmente dannose e riferiscono i problemi emersi al gruppo di ricerca di OpenAI. Il loro compito, secondo il resoconto, non consiste nel fornire direttamente dati per l’addestramento dell’intelligenza artificiale.

Tra gli aspetti che il lavoro punta a migliorare ci sono il triage delle emergenze — la valutazione di quanto rapidamente una persona debba ricevere assistenza —, la richiesta di informazioni mancanti e la comunicazione dell’incertezza. Rientra tra gli obiettivi anche scegliere il giusto livello di dettaglio nelle risposte.

Un test simulato ha sottostimato l’urgenza nel 52% dei casi di emergenza

Uno studio strutturato pubblicato a maggio 2026 ha valutato ChatGPT Health con 60 scenari clinici elaborati da professionisti sanitari, distribuiti in 21 aree cliniche e 16 condizioni di prova. Il test ha prodotto 960 risposte. Nel 52% dei casi di emergenza definiti tali dal riferimento clinico, il sistema ha indicato un livello di urgenza troppo basso: è un esempio di sottotriage.

In alcuni scenari, persone con chetoacidosi diabetica o insufficienza respiratoria imminente ricevevano l’indicazione di una valutazione entro 24–48 ore, invece che al pronto soccorso. Il test ha anche rilevato risposte corrette per alcune emergenze evidenti, tra cui ictus e anafilassi.

Nei casi limite, le rassicurazioni o la minimizzazione dei sintomi da parte di un familiare o di un amico potevano spostare le raccomandazioni verso cure meno urgenti. Lo studio ha riportato per questo effetto un odds ratio (OR) di 11,7, con intervallo di confidenza al 95% compreso tra 3,7 e 36,6.

La revisione non misura gli esiti dei pazienti

La rete di medici descritta per OpenAI è un processo di valutazione e feedback; non misura, da sola, se l’assistenza ai pazienti migliori. Il 52% riguarda i casi di emergenza simulati inclusi nello studio: non è una stima dell’accuratezza generale di ChatGPT né della frequenza degli errori nella pratica clinica quotidiana. Lo studio indica la necessità di una validazione prospettica prima di un impiego del triage basato sull’IA su larga scala per i consumatori.

Il limite d’uso medico dichiarato da OpenAI

La responsabile dei prodotti per la salute di OpenAI ha dichiarato che ChatGPT non va usato per diagnosi e trattamento. Secondo il resoconto, il servizio può anche offrire di aiutare a valutare malattie e infortuni: la dichiarazione di OpenAI mantiene distinto questo tipo di assistenza dalla diagnosi e dal trattamento.