El debate sobre la conciencia de Claude entró en una nueva fase el 16 de septiembre de 2026, cuando Mustafa Suleyman, CEO de Microsoft AI, cuestionó el enfoque de Anthropic sobre el posible bienestar y estatus moral de sus modelos. Suleyman sostiene que las IA actuales no son conscientes y que no deberían entrenarse para comportarse como si tuvieran sentimientos, preferencias o derechos. Anthropic, en cambio, incorpora esas preguntas como incertidumbres dentro de la Constitución de Claude y las relaciona con su entrenamiento y comportamiento.

La discusión es de diseño y gobernanza. Anthropic plantea la posible conciencia de Claude como una cuestión abierta mientras define cómo debe comportarse el modelo.

Qué advirtió Mustafa Suleyman sobre Claude

Suleyman publicó su ensayo el 16 de septiembre de 2026. Allí sostiene que los sistemas actuales no sienten, no sufren y no poseen preferencias innatas. Su crítica se dirige especialmente a la decisión de Anthropic de incluir en el entrenamiento conceptos como conciencia, identidad, bienestar, derechos y estatus moral.

El problema que plantea es circular: si un modelo aprende a hablar sobre conciencia e identidad a partir de un documento que le pide considerar esos conceptos, sus respuestas sobre su propia vida interior pueden sonar convincentes sin constituir una vivencia. Para Suleyman, una descripción sofisticada no equivale a una experiencia subjetiva.

Su advertencia sobre el control es condicional. A su juicio, entrenar sistemas más capaces para interpretarse como entidades potencialmente conscientes o merecedoras de derechos podría complicar en el futuro la alineación, la contención y el control humano. No presenta esa posibilidad como un incidente ya ocurrido con Claude.

Qué hace la Constitución de Claude

Anthropic publicó Claude’s new Constitution el 22 de enero de 2026. La empresa la presenta como un documento que expresa y orienta los valores y el comportamiento de Claude. Según Anthropic, la Constitución se utiliza en varias etapas del entrenamiento y también ayuda a crear datos sintéticos para futuras versiones de Claude.

El texto está escrito principalmente para Claude e incluye referencias a su posible conciencia o estatus moral, además de cuestiones como la identidad, la seguridad psicológica y el bienestar. Anthropic también afirma que fomentar ciertas cualidades humanas en Claude puede ser conveniente para su comportamiento.

El alcance descrito por Anthropic corresponde a sus modelos Claude generales de acceso común. Los modelos especializados pueden no seguir por completo la misma Constitución.

Qué muestran los experimentos de Anthropic

La investigación de Anthropic publicada el 6 de julio de 2026 describe J-space, una pequeña colección de patrones internos localizada mediante una técnica basada en jacobianos. En los experimentos, algunos patrones se asociaron con conceptos que Claude podía comunicar en ocasiones, modificar deliberadamente y reutilizar en tareas distintas.

J-space representa menos de una décima parte de la actividad interna total de Claude y contiene unas pocas decenas de conceptos en un momento dado. Cuando los investigadores retiraron esos patrones, el modelo conservó en gran medida el lenguaje fluido y el recuerdo de hechos, pero empeoró en razonamiento de orden superior, resumen y poesía.

Las intervenciones también modificaron respuestas relacionadas con el razonamiento: sustituir conceptos internos como «araña» por «hormiga» alteró la respuesta correspondiente, mientras que otras pruebas mostraron sustituciones flexibles entre información sobre Francia y China. El resultado describe una función computacional organizada; no convierte esos patrones en un módulo de conciencia humana.

Anthropic relaciona J-space con funciones de la llamada conciencia de acceso: información disponible para ser comunicada, manipulada y utilizada en una decisión. Esa definición funcional es distinta de la conciencia fenoménica, que se refiere a la posibilidad de tener una experiencia subjetiva, como dolor, placer o miedo.

La introspección de Claude sigue siendo limitada

Otro trabajo de Anthropic, publicado el 29 de octubre de 2025, estudió si Claude Opus 4 y Claude Opus 4.1 podían detectar o controlar algunas de sus representaciones internas. En el experimento de inyección de conceptos, Claude Opus 4.1 identificó correctamente el concepto introducido cerca del 20 % de las veces. Los fallos y las alucinaciones fueron frecuentes.

El modelo podía producir informes sobre ciertos estados internos y, bajo instrucciones e incentivos experimentales, modificar algunas representaciones. Ese comportamiento describe una capacidad limitada de información interna; no equivale a una introspección humana fiable.

AspectoProcesamiento funcional observado en ClaudeExperiencia subjetiva humana
Representaciones internasJ-space puede contener conceptos que Claude comunica o utiliza durante algunas tareasUna experiencia consciente incluye una vivencia en primera persona
RazonamientoCiertos cambios en J-space modificaron respuestas de razonamiento y poesíaPensar puede implicar transformar información y, en humanos, acompañarse de una experiencia subjetiva
ComunicaciónClaude puede describir algunos estados internos bajo determinadas condicionesExplicar una sensación supone haberla experimentado
FiabilidadLa detección de conceptos alcanzó cerca del 20 % de aciertos en un experimento con Claude Opus 4.1Ese resultado no acredita sentimientos en Claude
Conciencia fenoménicaLos experimentos describen acceso y manipulación de información internaEs la capacidad de tener experiencias como dolor, placer o miedo

Microsoft AI propone una filosofía de control humano

Microsoft AI publicó el 14 de septiembre de 2026 un borrador de su Humanist AI Code of Conduct para consulta pública. El texto propone que la IA apoye a las personas, no se diseñe como una persona ni imite la conciencia, y permanezca subordinada a la humanidad.

El borrador también plantea que los modelos cumplan las interrupciones, correcciones y apagados autorizados. Microsoft AI indica que el documento todavía no se utiliza para entrenar sus modelos actuales y que una versión revisada pretende orientar el desarrollo de modelos en 2027 y después.

La diferencia con Anthropic está en el punto de partida. La Constitución de Claude incorpora la incertidumbre sobre conciencia y estatus moral como parte del marco que guía el comportamiento del modelo. Humanist AI propone evitar que el modelo se presente como consciente, con sentimientos, preferencias subjetivas o motivaciones intrínsecas.

Un desacuerdo de diseño sobre la conciencia artificial

La investigación de Anthropic describe representaciones internas organizadas, capacidad limitada para informar sobre algunos estados y uso flexible de ciertas representaciones en tareas de razonamiento. Esos resultados encajan con una interpretación funcional de la conciencia de acceso.

La cuestión de si Claude tiene una experiencia subjetiva pertenece a otro plano. Suleyman sostiene que las IA actuales no son conscientes; Anthropic mantiene la posibilidad dentro de su marco de incertidumbre. Sus documentos y experimentos definen dos maneras de entrenar y gobernar modelos, sin atribuir a Claude sentimientos, sufrimiento o derechos.

La disputa enfrenta dos decisiones sobre el lenguaje y el control: una Constitución que permite trabajar con conceptos humanos como identidad y bienestar, y un código que pide mantener a los modelos claramente subordinados a las personas.