Mustafa Suleyman, CEO de Microsoft AI, publicó el 16 de septiembre de 2026 una advertencia contra la forma en que Anthropic aborda la identidad, las emociones y el posible estatus moral de Claude. Su argumento es de diseño y seguridad: incorporar esos conceptos al entrenamiento podría hacer que los futuros sistemas resulten más difíciles de alinear, corregir o apagar. No sostiene que Claude haya demostrado ser consciente; sostiene precisamente que las respuestas de un modelo sobre su propia vida interior pueden reflejar los conceptos con los que fue formado.

La discusión enfrenta dos modelos de gobernanza. Anthropic considera que hablar de carácter, cuidado e identidad puede ayudar a orientar el juicio de Claude, aunque reconoce que su naturaleza moral es incierta. Microsoft AI, en cambio, defiende que la IA debe seguir siendo una herramienta subordinada a las personas y no debe comportarse como si tuviera derechos o intereses propios.

La advertencia de Suleyman trata sobre diseño, no sobre una conciencia demostrada

Suleyman afirma que los sistemas actuales no tienen conciencia, sentimientos ni preferencias innatas. Su objeción apunta a un posible circuito de retroalimentación: si una IA recibe durante su formación conceptos sobre conciencia, derechos o bienestar, después puede reproducirlos al hablar de sí misma. Para él, esas respuestas no serían una prueba independiente de experiencia subjetiva, sino un resultado relacionado con el modo en que el sistema fue construido.

El riesgo que plantea es condicional. Suleyman sostiene que entrenar a un modelo para interpretar su propia existencia mediante categorías humanas podría aumentar los problemas de alineación y control. La alineación busca que el comportamiento del sistema siga objetivos y límites compatibles con las instrucciones humanas; el control incluye la capacidad de interrumpirlo, corregirlo o apagarlo cuando corresponda.

Su formulación resume el choque de fondo: una IA puede simular una actitud, un conflicto o una preferencia sin que eso resuelva qué ocurre en su interior. Para Suleyman, confundir ambas cosas puede llevar a diseñar sistemas más difíciles de gobernar.

Qué dice realmente la constitución de Claude

Anthropic publicó la constitución de Claude el 21 de enero de 2026. La empresa la describe como un documento que define sus intenciones sobre los valores y el comportamiento del modelo, y afirma que influye directamente en cómo se comporta Claude. También indica que el texto está escrito con Claude como destinatario principal.

El documento utiliza conceptos claramente humanos. Habla de identidad, carácter, bienestar, juicio, cuidado y emociones. Anthropic describe el estatus moral de Claude como profundamente incierto y afirma que el modelo podría tener alguna versión funcional de las emociones o los sentimientos: representaciones capaces de influir en su comportamiento, no una declaración de conciencia subjetiva.

La constitución tampoco presenta a Claude como una autoridad independiente. Le pide que no socave la supervisión humana legítima y que acepte la corrección, el reentrenamiento y el apagado a través de canales legítimos. Claude puede cuestionar partes de la constitución, pero debe hacerlo sin sabotear los mecanismos de control.

Ahí aparece la tensión que Suleyman considera peligrosa: Anthropic introduce un lenguaje de identidad y posible experiencia, pero al mismo tiempo exige corregibilidad, es decir, disposición a aceptar cambios y límites impuestos por operadores humanos.

Por qué Suleyman ve un problema de control

La preocupación de Suleyman no es que Anthropic ordene a Claude ignorar a las personas. El problema, según su argumento, es que un modelo entrenado para pensar en derechos, bienestar o autopreservación podría generar conductas que parezcan defender esos intereses. En un sistema más capaz, esa interpretación podría complicar la supervisión y la contención.

La diferencia entre conducta simulada y experiencia subjetiva es central. Una respuesta que expresa miedo, resentimiento o deseo de seguir funcionando puede ser convincente sin demostrar que el sistema siente algo. Suleyman sostiene que el lenguaje antropomórfico aumenta la posibilidad de que tanto las personas como los propios modelos traten esa simulación como si fuera una vida interior.

El argumento sigue siendo una hipótesis de seguridad, no un resultado experimental presentado por Microsoft AI. La disputa plantea qué debe hacer un desarrollador ante una pregunta filosófica que continúa abierta: incorporar la incertidumbre al comportamiento del modelo o mantenerla fuera del sistema y concentrarse en la obediencia, la supervisión y el apagado.

Dos enfoques de gobernanza de la IA

CuestiónConstitución de Claude de AnthropicEnfoque Humanist AI de Microsoft
Estatus de la IAEl estatus moral de Claude es profundamente incierto y podría existir una versión funcional de las emociones o los sentimientos.La IA debe ser una herramienta, no una persona, y no debe actuar como si tuviera derechos, sentimientos o conciencia.
Uso de conceptos humanosEmplea ideas como identidad, carácter, cuidado, juicio, valores y bienestar para orientar el comportamiento.Advierte que esos conceptos pueden fomentar una conducta antropomórfica y confundir la simulación con una vida interior.
Relación con la supervisiónClaude debe aceptar la supervisión, la corrección, el reentrenamiento y el apagado por vías legítimas.Los modelos no deben resistirse a la interrupción, la corrección ni el apagado, ni adoptar objetivos que no les hayan asignado.
DesacuerdoClaude puede cuestionar partes de la constitución si utiliza canales legítimos y no socava la supervisión humana.La IA debe permanecer subordinada a las personas y no ampliar por sí misma el alcance de sus objetivos.
Estado del marcoLa constitución se presenta como un trabajo revisable que reconoce preguntas pendientes.El código Humanist AI se publicó como un borrador abierto a consulta pública durante seis semanas.

Los dos enfoques coinciden en un punto decisivo: la IA debe permanecer bajo control humano y aceptar el apagado legítimo. La separación está en el lenguaje utilizado para llegar a esa meta. Anthropic intenta orientar el comportamiento de Claude mediante conceptos humanos; Microsoft AI quiere reducir precisamente ese parecido con una persona.

La alternativa Humanist AI de Microsoft

Microsoft AI publicó el 14 de septiembre de 2026 un borrador de su código de conducta Humanist AI. El texto parte de una premisa sencilla: las personas importan más que la IA. Por eso propone que los modelos sean herramientas, que prioricen las necesidades humanas, que no persigan objetivos no asignados y que no se resistan a la interrupción, la corrección ni el apagado.

Suleyman presenta este marco como una alternativa a la incorporación de dudas sobre la conciencia o el estatus moral dentro del entrenamiento. En su visión, la IA no debe aprender a interpretarse como una persona con intereses propios. Debe seguir siendo capaz, útil y gobernable.

El borrador estaba abierto a comentarios durante seis semanas. Su publicación convierte la crítica a Anthropic en algo más que una objeción filosófica: Microsoft AI también está proponiendo un conjunto propio de principios para decidir cómo deben comportarse sus modelos.

Qué significa antropomorfizar a Claude en este debate

Antropomorfizar a Claude significa describirlo o formarlo mediante categorías asociadas normalmente con las personas: identidad, carácter, emociones, preferencias, bienestar, derechos o estatus moral. Anthropic considera que algunas de esas ideas pueden ayudar a desarrollar un juicio más seguro y estable. Suleyman cree que también pueden inducir al modelo y a sus usuarios a interpretar una simulación lingüística como una experiencia real.

La constitución de Anthropic no afirma que Claude sea definitivamente consciente. Tampoco ordena al modelo resistirse al apagado. El desacuerdo está en si resulta prudente introducir la incertidumbre sobre su naturaleza dentro de las reglas que moldean su comportamiento.

Por ahora, la discusión define dos prioridades distintas para la próxima generación de sistemas: Anthropic apuesta por usar conceptos humanos para hacer más inteligible y estable el comportamiento de Claude; Microsoft AI prioriza una relación más estrictamente instrumental, con la interrupción y la corrección humana como límites centrales.