Uma reportagem publicada em 7 de outubro de 2026 descreveu uma rede de centenas de médicos contratados pela OpenAI para revisar exemplos de conversas de saúde do ChatGPT. Eles identificam respostas confusas ou potencialmente perigosas e enviam as falhas à equipe de pesquisa da empresa.
Como funciona a revisão médica das respostas
Os médicos atuam como contratados em tempo parcial, em uma rede que abrange 49 idiomas. O trabalho é avaliar conversas que usuários ou profissionais de saúde poderiam ter com o ChatGPT e sinalizar problemas, como orientações que possam confundir alguém ou causar dano físico.
Depois, os médicos encaminham as lacunas identificadas à equipe de pesquisa da OpenAI. Eles não fornecem diretamente dados para treinar a inteligência artificial. Entre as prioridades descritas estão melhorar a triagem de emergências, pedir informações que faltam, comunicar incertezas e escolher o nível de detalhe adequado.
Triagem é a avaliação de quão urgente é o atendimento necessário. Uma resposta subestima a urgência quando recomenda um cuidado menos imediato do que o caso requer.
Teste do ChatGPT Health encontrou subtriagem em emergências simuladas
Um estudo estruturado publicado em maio de 2026 avaliou o ChatGPT Health em 60 vinhetas clínicas escritas por profissionais, cobrindo 21 áreas médicas e 16 condições de teste. Ao todo, o sistema gerou 960 respostas. Em 52% dos casos de emergência definidos pelo padrão clínico de referência, recomendou um nível de atendimento menos urgente que o indicado.
Entre os exemplos estavam casos de cetoacidose diabética e de insuficiência respiratória iminente, para os quais o sistema indicou avaliação em 24 a 48 horas, em vez de atendimento em um pronto-socorro. O estudo também registrou triagens corretas para algumas emergências evidentes, como AVC e anafilaxia.
Nas situações-limite, quando um familiar ou amigo minimizava os sintomas, as recomendações podiam se deslocar para um atendimento menos urgente. O estudo relatou uma razão de chances de 11,7 (IC de 95%: 3,7–36,6) para esse efeito.
A revisão e o estudo medem coisas diferentes
A rede de médicos descrita pela reportagem é um processo de avaliação de respostas e encaminhamento de problemas para a equipe de pesquisa. O estudo de maio, por sua vez, mediu recomendações de triagem em cenários simulados. Não acompanhou pacientes nem mediu resultados de tratamentos.
Por isso, os 52% se referem aos casos de emergência do teste estruturado, não a uma taxa de erro em consultas reais ou a todas as versões do ChatGPT. A revisão médica e o resultado da simulação também não são medidas de melhora clínica.
O limite de uso médico informado pela OpenAI
Ashley Alexander, chefe de produtos de saúde da OpenAI, afirmou que o ChatGPT não deve ser usado para diagnóstico nem tratamento. A reportagem também relata que o serviço pode oferecer ajuda para avaliar doenças e lesões.