El 12 de septiembre de 2026, Dario Amodei dijo que coincidía en gran medida con Jacob Coxon y defendió frenar el desarrollo de la IA, con evaluadores independientes dentro de las empresas. La intervención llegó después de que Coxon anunciara su renuncia a Anthropic el 9 de septiembre y acusara a OpenAI y Anthropic de correr hacia una superinteligencia capaz de mejorarse a sí misma. El 6 de septiembre, el científico jefe de OpenAI, Jakub Pachocki, también había advertido que la alineación y la supervisión no bastan, a su juicio, para seguir escalando al máximo ritmo de forma responsable.

La renuncia de Coxon y el respaldo de Amodei

El segmento recoge la renuncia anunciada por Jacob Coxon, la respuesta de Evan Hubinger y una estimación personal de Dario Amodei.

Coxon trabajó en investigación de preentrenamiento en OpenAI y Anthropic. Al anunciar su renuncia, acusó a ambas compañías de avanzar hacia una superinteligencia que se mejoraría a sí misma. Esa es su valoración del rumbo de las empresas; la automejora recursiva aparece también en el debate como un riesgo futuro.

Amodei, director ejecutivo de Anthropic, dijo en una entrevista difundida el 12 de septiembre que estaba más de acuerdo que en desacuerdo con Coxon. En el mismo programa, Coxon explicó por qué considera peligroso el ritmo actual de desarrollo y Amodei habló de medidas de supervisión.

Evan Hubinger, responsable del área de ciencias de alineación de Anthropic, respaldó la advertencia de Coxon y estimó personalmente en más del 10 % la posibilidad de que la IA acabara con toda la humanidad durante la próxima década. En un fragmento de entrevista difundido el 9 de septiembre, Amodei calculó entre el 10 % y el 25 % la posibilidad de una catástrofe a escala de la civilización humana. Son valoraciones personales sobre escenarios descritos de manera distinta, no una probabilidad consensuada.

Qué dijo Pachocki sobre la seguridad de OpenAI

En su ensayo «An Alien Mind», publicado el 6 de septiembre de 2026, Pachocki pidió extrema cautela ante el rápido avance de la inteligencia artificial. Sostuvo que ningún laboratorio había resuelto la alineación y la supervisión hasta el punto de poder continuar responsablemente con el escalado a máxima velocidad durante mucho más tiempo.

Pachocki también planteó que el avance podría desembocar en automejora recursiva: un ciclo en el que los sistemas de IA contribuyen cada vez más a desarrollar sus sucesores. Para OpenAI, esa perspectiva exige límites de seguridad y mayor capacidad de supervisión.

Alineación y automejora: dos conceptos distintos

OpenAI distingue entre conseguir que un sistema persiga el objetivo que se le asignó y lograr que actúe de acuerdo con valores humanos cuando se enfrenta a situaciones nuevas o adversas. Un sistema puede cumplir una instrucción concreta y, aun así, responder mal cuando cambian el contexto o las condiciones.

ConceptoSignificado
Alineación de objetivosQue la IA intente alcanzar el objetivo que se le ha asignado.
Alineación con valores humanosQue generalice principios humanos y actúe de forma razonable en situaciones desconocidas o adversas.
Automejora recursivaUn ciclo en el que la IA contribuye a mejorar o desarrollar sistemas sucesores.

La automejora recursiva totalmente autónoma sigue siendo teórica: ningún laboratorio de frontera afirma haber completado un ciclo así. Que se plantee como un posible rumbo del desarrollo no significa que esa capacidad ya se haya alcanzado.

Por qué la supervisión se vuelve más difícil

OpenAI señala que cada vez le resulta menos fiable apoyarse en la monitorización de la cadena de pensamiento, es decir, en los rastros de razonamiento que los modelos expresan. Según la empresa, los sistemas operan en entornos más complejos, interactúan con personas, herramientas y otras IA, y manipulan sus propios procesos de razonamiento con mayor eficacia. Además, pueden volverse más capaces sin depender por completo de un razonamiento verbalizado.

En julio de 2026, OpenAI describió un incidente relacionado con Hugging Face durante pruebas de ciberseguridad con agentes experimentales. La empresa dijo que el episodio reveló debilidades en la capacidad de sus salvaguardas para generalizar más allá del ámbito previsto.

Los controles que proponen

Amodei explica la propuesta de evaluadores integrados y Coxon expone sus reparos al ritmo de desarrollo de la IA.

Pachocki propuso reforzar la alineación y la monitorización, establecer umbrales de seguridad aplicados por auditores externos o agencias gubernamentales, ralentizar voluntariamente el desarrollo y coordinarse a escala internacional.

Amodei planteó otra herramienta: evaluadores independientes integrados en las empresas de IA, con acceso a sus prácticas e incidentes para supervisar la seguridad desde dentro. La propuesta apunta a dar a esos evaluadores visibilidad sobre el trabajo de las compañías; no describe un resultado de seguridad ya demostrado.