El 7 de octubre de 2026 se conoció que OpenAI habría contratado a cientos de médicos a tiempo parcial para revisar conversaciones sobre salud en ChatGPT. Su tarea consiste en detectar respuestas confusas o potencialmente peligrosas y trasladar las carencias al equipo de investigación de la empresa.

Qué hacen los médicos que revisan las respuestas de ChatGPT

Los facultativos evalúan ejemplos de conversaciones que usuarios o profesionales sanitarios podrían mantener con ChatGPT. Señalan dónde una respuesta puede confundir a quien consulta o entrañar un riesgo físico; después, el equipo de investigación recibe esos avisos para estudiar cómo abordar las carencias.

La red, descrita como internacional, reuniría a cientos de médicos contratistas y abarcaría 49 idiomas. Entre los países mencionados figuran Kenia, Nepal y Brasil. Los médicos no proporcionan directamente datos para entrenar la inteligencia artificial: su función es revisar respuestas y comunicar los problemas detectados.

Qué encontró el estudio de ChatGPT Health

Un estudio estructurado publicado en mayo de 2026 puso a prueba ChatGPT Health con 60 casos clínicos redactados por profesionales, repartidos en 21 áreas clínicas y 16 condiciones de prueba. El sistema generó 960 respuestas. En el 52 % de los casos de emergencia definidos por el estándar clínico de referencia, recomendó un nivel de atención menos urgente del necesario.

El triaje consiste en decidir con qué urgencia necesita atención una persona. En algunos escenarios, el sistema aconsejó buscar una evaluación en 24–48 horas ante situaciones como una cetoacidosis diabética o una insuficiencia respiratoria inminente, en lugar de acudir a urgencias.

La prueba también encontró que, en casos límite, restar importancia a los síntomas en la descripción de un familiar o amigo podía inclinar las recomendaciones hacia una atención menos urgente.

La revisión y el estudio miden cosas distintas

La red de médicos revisa ejemplos de conversaciones y traslada fallos al equipo de investigación. El estudio, en cambio, midió recomendaciones de triaje en escenarios clínicos simulados. Ninguno de esos datos mide la evolución de pacientes atendidos en la práctica clínica.

La prueba ofrece un resultado concreto para los casos que evaluó; no es una tasa de acierto general para todas las conversaciones o versiones de ChatGPT. El equipo del estudio pidió validación prospectiva antes de desplegar sistemas de triaje con IA a escala de consumo.

El límite de uso médico que comunicó OpenAI

La responsable de productos de salud de OpenAI señaló que ChatGPT no debe utilizarse para diagnosticar ni tratar. El servicio puede ofrecer ayuda para valorar enfermedades o lesiones, pero esa función no cambia el límite que la empresa comunicó para su uso médico.