W relacji opublikowanej 7 października 2026 r. opisano, że OpenAI korzysta z sieci setek lekarzy pracujących na część etatu. Oceniają przykładowe rozmowy dotyczące zdrowia, wskazują odpowiedzi, które mogą wprowadzać w błąd lub zagrażać zdrowiu, i przekazują zauważone luki zespołowi badawczemu firmy. Osobne badanie ChatGPT Health, opublikowane w maju 2026 r., wykazało zaniżanie pilności w 52% symulowanych przypadków nagłych.

OpenAI korzysta z lekarzy do oceny zdrowotnych odpowiedzi ChatGPT

Opisywana sieć obejmuje setki praktykujących lekarzy i 49 języków. Medycy sprawdzają przykłady rozmów, jakie użytkownicy lub klinicyści mogą prowadzić z ChatGPT, szukając odpowiedzi mylących albo mogących doprowadzić do fizycznej szkody. Praca sieci obejmuje między innymi różne specjalizacje i kraje.

Relacja opisuje też Rebeccę Soskin Hicks, która kieruje tym przedsięwzięciem i dołączyła do OpenAI w 2024 r. Jej zespół przekazuje luki w odpowiedziach zespołowi badawczemu. Lekarze nie dostarczają bezpośrednio danych treningowych.

Co sprawdzają lekarze i jak trafiają ich uwagi do badaczy

Lekarze oceniają przykładowe rozmowy pod kątem niejasnych lub potencjalnie niebezpiecznych odpowiedzi. Wśród wskazanych obszarów pracy są również triaż, czyli ocena, jak pilnie pacjent potrzebuje pomocy, dopytywanie o brakujące informacje, komunikowanie niepewności i dobieranie właściwego poziomu szczegółowości.

Tak opisany przegląd to proces wychwytywania luk i przekazywania ich do dalszej pracy badawczej. Badanie ChatGPT Health sprawdzało osobno, jak system formułuje zalecenia dotyczące pilności pomocy w symulowanych scenariuszach.

Test ChatGPT Health zaniżał pilność w części nagłych przypadków

Badanie opublikowane w maju 2026 r. objęło 60 opisów przypadków przygotowanych przez klinicystów, 21 dziedzin medycyny i 16 warunków testowych. Wygenerowano 960 odpowiedzi. W 52% przypadków uznanych w teście za nagłe ChatGPT Health zalecił opiekę o zbyt niskim poziomie pilności.

W części symulacji przypadki kwasicy ketonowej i zbliżającej się niewydolności oddechowej kierowano do oceny w ciągu 24–48 godzin zamiast na szpitalny oddział ratunkowy. Badanie wykazało też, że w przypadkach granicznych bagatelizowanie objawów przez rodzinę lub znajomych wiązało się z przesunięciem zaleceń ku mniej pilnej opiece. Iloraz szans wyniósł 11,7, a 95-proc. przedział ufności: 3,7–36,6.

Autorzy badania postulowali prospektywną walidację przed wdrożeniem triażu AI na szeroką skalę. Wyniki dotyczą testu symulacyjnego, a nie przebiegu opieki nad pacjentami w codziennym użyciu.

Granica zastosowania medycznego wskazana przez OpenAI

Ashley Alexander, szefowa produktów zdrowotnych OpenAI, powiedziała, że ChatGPT nie powinien służyć do diagnozowania ani leczenia. Jednocześnie usługa może proponować pomoc w ocenie chorób i urazów.

Przegląd lekarzy opisuje sposób identyfikowania problematycznych odpowiedzi, a badanie z maja 2026 r. mierzyło zalecenia dotyczące pilności w określonym zestawie symulowanych przypadków.