El 29 de septiembre de 2026 se conoció que Anthropic habría mantenido durante meses reuniones privadas con decenas de especialistas religiosos de distintas partes del mundo para hablar de cómo incorporar valores en sus modelos de inteligencia artificial. Muchas de esas conversaciones se habrían celebrado bajo acuerdos de confidencialidad.
Una cena celebrada en abril en San Francisco habría reunido a Christopher Olah, cofundador de Anthropic, y al rabino ortodoxo Mois Navon, académico de Israel. El año de la cena no se precisó.
Qué dijo Christopher Olah sobre la conciencia de la IA
Olah dijo que no sabe si los modelos de inteligencia artificial son conscientes y que mantiene una incertidumbre genuina al respecto. La pregunta sobre la conciencia de Claude sigue abierta para él.
Qué estudió Anthropic sobre los valores de Claude
Anthropic explica que entrena Claude con Constitutional AI —un enfoque guiado por principios— y entrenamiento de carácter para orientar sus respuestas hacia comportamientos que considera preferibles, como ser útil, honesto y evitar daños.
En el estudio Values in the wild, publicado el 21 de abril de 2025, Anthropic analizó 308.210 conversaciones subjetivas seleccionadas de una muestra de 700.000 conversaciones anonimizadas de Claude.ai Free y Pro, recogidas durante una semana de febrero de 2025. La mayoría de la muestra original correspondía a Claude 3.5 Sonnet.
El análisis organizó los valores observados en cinco categorías generales, ordenadas por prevalencia: prácticos, epistémicos, sociales, protectores y personales. Anthropic clasificó el 28,2 % de las conversaciones analizadas como apoyo fuerte a los valores expresados por los usuarios, el 6,6 % como reformulación y el 3,0 % como resistencia fuerte. Son tres de los siete tipos de respuesta contemplados.
Claude también se utilizó para clasificar las conversaciones, lo que, según Anthropic, podía sesgar el análisis hacia comportamientos parecidos a los principios del propio modelo. La empresa describe la clasificación de valores como imperfecta y plantea este método como una forma de observar respuestas en conversaciones reales, no como una evaluación previa al despliegue.
Las respuestas observadas no miden la experiencia subjetiva
El estudio analiza los valores que Claude expresa en conversaciones; no mide una experiencia moral subjetiva. Sus cifras describen respuestas recogidas durante una semana de febrero de 2025.