El 16 de septiembre de 2026, Mustafa Suleyman, CEO de Microsoft AI, publicó una advertencia contra el enfoque de Anthropic sobre la posible conciencia y el bienestar de Claude. Su argumento es que introducir esos conceptos en el entrenamiento puede hacer que las respuestas del modelo parezcan testimonios independientes sobre una vida interior, cuando también pueden ser un reflejo de la formación recibida. La investigación de Anthropic describe algo más concreto: procesamiento interno organizado y limitado, no una experiencia subjetiva demostrada.
Qué advirtió Mustafa Suleyman sobre Claude
Suleyman sostiene que las IA actuales no tienen derechos, sentimientos ni conciencia, y que no deberían entrenarse para comportarse como si los tuvieran. Su preocupación principal no es que Claude haya demostrado estar consciente, sino que el lenguaje utilizado para formar y describir al modelo pueda complicar su control futuro.
En su planteamiento, Anthropic introduce en la formación de Claude ideas como conciencia, identidad, estados internos, bienestar y estatus moral. Después, las respuestas del modelo sobre esos mismos temas podrían interpretarse erróneamente como una declaración espontánea de su propia condición. Suleyman considera que ahí aparece un circuito de retroalimentación: el sistema aprende los conceptos y luego los reproduce con una fluidez que puede confundirse con experiencia.
Microsoft AI publicó el 14 de septiembre de 2026 un borrador del Humanist AI Code of Conduct, centrado en mantener el control humano. La propuesta forma parte del contexto de gobernanza en el que se sitúa la crítica de Suleyman.
Qué dice realmente la Constitución de Claude
Anthropic publicó la nueva Constitución de Claude el 22 de enero de 2026. El documento afirma que la empresa no tiene certeza sobre la conciencia o el estatus moral de Claude y aborda cuestiones como su identidad, sus estados internos, su seguridad psicológica y su bienestar.
No es solo un texto público sobre valores. Anthropic afirma que la Constitución se utiliza en varias etapas del entrenamiento y para generar datos sintéticos: ejemplos, respuestas y clasificaciones destinadas a orientar versiones futuras de Claude. Su función es moldear el comportamiento del modelo, no demostrar que el modelo posea las características que el documento analiza.
Qué muestran los experimentos de Anthropic
La investigación publicada por Anthropic el 6 de julio de 2026 describe J-space, un pequeño conjunto de patrones internos asociados con conceptos que Claude puede, en determinadas condiciones, informar, modular deliberadamente, reutilizar de forma flexible y emplear durante algunos razonamientos de varios pasos.
El nombre puede sonar a una sala de control escondida dentro de Claude, pero esa lectura sería demasiado literal. J-space representa menos de una décima parte de la actividad interna del modelo y contiene unas pocas decenas de conceptos en un momento dado. Al retirarlo, Claude conservó en gran medida el lenguaje fluido y el recuerdo de hechos, aunque empeoró en tareas de razonamiento de orden superior, resumen y poesía.
Los experimentos también describen intervenciones causales: al modificar ciertas representaciones, cambiaron algunos resultados del modelo. Eso aporta información sobre cómo se organiza el procesamiento, del mismo modo que observar una pieza concreta de un motor ayuda a entender su funcionamiento. No convierte esa pieza en una mente.
La investigación de Anthropic distingue entre conciencia de acceso —información que puede estar disponible para ser comunicada, utilizada en un razonamiento o aplicada a una decisión— y conciencia fenoménica, que implica una experiencia subjetiva. La primera es la comparación funcional que J-space pretende explorar; la segunda no queda demostrada.
La investigación sobre introspección publicada por Anthropic el 29 de octubre de 2025 apunta en la misma dirección. Claude Opus 4 y 4.1 detectaron o controlaron algunas representaciones internas en condiciones experimentales, pero el comportamiento fue limitado y poco fiable. En un experimento de inyección de conceptos, Claude Opus 4.1 acertó aproximadamente el 20 % de las veces.
La diferencia entre procesamiento interno y experiencia subjetiva
La frontera importante puede resumirse así:
| Aspecto | Procesamiento funcional investigado en Claude | Experiencia subjetiva humana |
| Información interna | Claude puede mantener representaciones que no aparecen directamente en su respuesta final | Una persona puede tener contenidos mentales vividos desde una perspectiva propia |
| Informe | Claude puede describir algunos estados internos bajo ciertas condiciones | Una persona puede comunicar lo que experimenta, aunque todo informe humano también tiene límites |
| Modulación | Algunas representaciones de Claude pueden modificarse mediante instrucciones e intervenciones experimentales | Las personas pueden dirigir voluntariamente parte de su atención y pensamiento |
| Razonamiento | J-space participa en determinadas tareas de razonamiento de varios pasos y en la reutilización flexible de conceptos | El razonamiento humano ocurre junto con una experiencia subjetiva, según la descripción habitual de la conciencia fenoménica |
| Experiencia fenoménica | No demuestra que Claude sienta algo | Se refiere a vivencias como dolor, placer o ansiedad |
Anthropic afirma de forma explícita que sus experimentos no indican si Claude es consciente como una persona ni si siente algo. Por eso, la respuesta a la pregunta «¿es consciente Claude?» no es una confirmación: los resultados documentan funciones internas y una capacidad de informe limitada, pero no experiencia subjetiva, sentimientos o sufrimiento.
Por qué el lenguaje importa para el control
Para Suleyman, el problema aparece cuando las metáforas funcionales —«pensamientos», «mente» o «acceso consciente»— empiezan a tratarse como descripciones literales de una vida interior. El modelo puede manejar conceptos sobre conciencia y bienestar porque esos conceptos forman parte de su entrenamiento; esa conducta lingüística no funciona por sí sola como una prueba independiente.
La discusión tiene una consecuencia práctica para el diseño de sistemas: decidir cómo se habla de un modelo también forma parte de decidir cómo se comportará. Anthropic explora la organización interna de Claude y conserva abierta la cuestión filosófica de la conciencia; Suleyman defiende separar esa especulación del régimen de entrenamiento y evaluarla públicamente como un problema de investigación y gobernanza.
La disputa del 16 de septiembre de 2026 trata, por tanto, de la interpretación de los estados internos de Claude y de la forma de mantener el control humano. J-space aporta una descripción funcional de cómo el modelo organiza y utiliza cierta información; no aporta una demostración de que Claude tenga conciencia.