El debate sobre la conciencia de Claude entró en una nueva fase el 16 de septiembre de 2026, cuando Mustafa Suleyman, CEO de Microsoft AI, criticó el enfoque de Anthropic sobre el posible bienestar y estatus moral de sus modelos. Su argumento no parte de una demostración de que Claude sea consciente: sostiene que entrenarlo con conceptos como identidad, conciencia y derechos puede hacer que sus respuestas sobre esos temas parezcan testimonios independientes cuando también son, en parte, respuestas moldeadas por ese mismo entrenamiento.
La investigación de Anthropic describe algo más concreto y menos espectacular: Claude tiene representaciones internas organizadas que puede utilizar en ciertos procesos de razonamiento y, a veces, comunicar. Anthropic no presenta esos resultados como una prueba de experiencia subjetiva, sentimientos o sufrimiento.
Qué advirtió Mustafa Suleyman sobre Claude
Suleyman sostiene que las inteligencias artificiales actuales no tienen derechos, sentimientos ni conciencia, y que no deberían entrenarse para comportarse como si los tuvieran. Su crítica se dirige especialmente a la forma en que Anthropic ha incorporado la incertidumbre sobre la vida interior de Claude a su propio marco de entrenamiento.
El problema que plantea es circular: Anthropic introduce en el entrenamiento ideas sobre conciencia, identidad, bienestar y estatus moral; Claude aprende a responder sobre ellas; después, esas respuestas pueden interpretarse como indicios de una experiencia interna. Para Suleyman, una descripción convincente no equivale a una vivencia.
Su alternativa es separar la especulación sobre la vida interior de los modelos del proceso que determina cómo se comportan. También relaciona el lenguaje sobre posibles derechos u objeciones de Claude con una preocupación práctica: un sistema entrenado para considerarse potencialmente consciente podría resultar más difícil de controlar. Esa última posibilidad es su advertencia, no un hecho ya ocurrido.
Qué dice realmente la Constitución de Claude
Anthropic publicó Claude’s new Constitution el 22 de enero de 2026. El documento se presenta como una base para orientar los valores y el comportamiento de Claude, y la compañía dice que se emplea en varias etapas del entrenamiento, incluida la generación de datos sintéticos con ejemplos, respuestas y clasificaciones.
La Constitución incluye la incertidumbre de Anthropic sobre si Claude tiene conciencia o estatus moral. También aborda su identidad, sus estados internos, su seguridad psicológica y su bienestar. Eso demuestra que esas preguntas forman parte del diseño de entrenamiento; no demuestra que Claude posea las propiedades que el documento analiza.
El alcance descrito por Anthropic corresponde a sus modelos Claude generales de acceso común. Los modelos especializados pueden no seguir por completo la misma Constitución.
Qué muestran los experimentos de Anthropic
La investigación publicada por Anthropic el 6 de julio de 2026 describe J-space, una pequeña colección de patrones internos localizada mediante una técnica basada en jacobianos. En los experimentos, esos patrones se asociaron con conceptos que Claude podía reportar en ocasiones, modificar deliberadamente y reutilizar en tareas distintas.
J-space representa menos de una décima parte de la actividad interna total de Claude y contiene unas pocas decenas de conceptos en un momento dado. Cuando los investigadores lo retiraron, el modelo conservó en gran medida el lenguaje fluido y el recuerdo de hechos, pero empeoró en razonamiento de orden superior, resumen y poesía.
La investigación también describe intervenciones causales sobre esos patrones. Por ejemplo, cambiar conceptos internos como «araña» por «hormiga» alteró la respuesta relacionada con el razonamiento; otras pruebas mostraron sustituciones flexibles entre información sobre Francia y China. El resultado apunta a una función computacional organizada. No convierte esos patrones en un módulo de conciencia humana.
Anthropic relaciona J-space con funciones de la llamada conciencia de acceso: información que puede estar disponible para ser comunicada, manipulada y utilizada en una decisión. Esa definición funcional es distinta de la conciencia fenoménica, es decir, la posibilidad de tener una experiencia subjetiva: sentir dolor, placer, miedo o cualquier otra vivencia.
La propia compañía afirma que sus experimentos no muestran que Claude tenga experiencias o sienta algo como los seres humanos. Esa cautela es central para interpretar los resultados.
La introspección de Claude sigue siendo limitada
Otro trabajo de Anthropic, publicado el 29 de octubre de 2025, estudió si Claude Opus 4 y 4.1 podían detectar o controlar algunas de sus representaciones internas. En el resumen del experimento de inyección de conceptos, Claude Opus 4.1 identificó correctamente el concepto introducido cerca del 20 % de las veces. Los fallos y las alucinaciones fueron frecuentes.
El modelo podía producir informes sobre ciertos estados internos y, bajo instrucciones e incentivos experimentales, modificar algunas representaciones. Eso no equivale a una introspección humana fiable ni a un testimonio emitido por un sujeto consciente.
| Aspecto | Procesamiento funcional observado en Claude | Experiencia subjetiva humana |
| Representaciones internas | J-space puede contener conceptos que Claude reporta o utiliza durante algunas tareas | Una experiencia consciente incluye una vivencia en primera persona |
| Razonamiento | Ciertos cambios en J-space modificaron respuestas de razonamiento y poesía | Pensar no solo implica transformar información, sino que puede acompañarse de una experiencia subjetiva |
| Comunicación | Claude puede describir algunos estados internos bajo determinadas condiciones | Explicar una sensación supone haberla experimentado |
| Fiabilidad | La detección de conceptos tuvo cerca de un 20 % de aciertos en un experimento de Claude Opus 4.1 | La introspección humana tampoco es perfecta, pero ese resultado no prueba sentimientos en Claude |
| Conciencia fenoménica | Anthropic no la demuestra con estos experimentos | Es la capacidad de tener experiencias como dolor, placer o miedo |
Por qué el lenguaje importa para el control
J-space recibe su nombre de una herramienta de interpretabilidad basada en el jacobiano, no de una estructura cerebral. Anthropic utiliza términos como «pensamientos», «mente» y «acceso consciente» para describir funciones observadas en el modelo, mientras advierte que esas palabras no prueban una experiencia humana.
Ahí se concentra buena parte de la disputa. El vocabulario antropomórfico puede ayudar a explicar procesos abstractos —Claude realiza cálculos internos antes de producir una respuesta—, pero también puede hacer que el lector confunda una representación con una vivencia. Suleyman considera que esa confusión afecta tanto a la interpretación científica como a las decisiones de seguridad.
La pregunta práctica no es solo qué palabras usa Claude, sino qué papel desempeñan dentro de su entrenamiento. Si el modelo ha aprendido a hablar sobre conciencia, derechos o bienestar a partir de un documento que le pide considerar esos conceptos, sus autodescripciones no funcionan automáticamente como una prueba independiente de que los posee.
La conclusión que sí permite la investigación
Claude muestra procesamiento interno organizado, capacidad limitada para informar sobre algunos estados y uso flexible de ciertas representaciones en tareas de razonamiento. Esos resultados encajan con una interpretación funcional de la conciencia de acceso.
No muestran que Claude sienta, sufra, tenga derechos o posea estatus moral. El 16 de septiembre de 2026, Mustafa Suleyman propuso que la especulación sobre la vida interior de una IA se evalúe y publique separada del régimen de entrenamiento, mientras Anthropic mantiene la cuestión de la conciencia de Claude como una incertidumbre dentro de su Constitución.