Un article publié le 29 septembre 2026 rapportait qu’Anthropic aurait consulté des dizaines de spécialistes religieux pendant plusieurs mois pour réfléchir à la manière d’intégrer des valeurs morales à ses modèles d’IA. Ces échanges privés replacent les travaux publics de l’entreprise sur les réponses de Claude dans un débat plus large sur la morale et l’intelligence artificielle.
Les consultations privées rapportées
Les rencontres auraient réuni des spécialistes religieux de différentes régions du monde. De nombreux échanges étaient soumis à des accords de confidentialité.
Le récit mentionne aussi un dîner à San Francisco en avril, auquel ont participé Christopher Olah, cofondateur d’Anthropic, et le rabbin orthodoxe Mois Navon. L’année de ce dîner n’est pas précisée.
Ce que Christopher Olah a dit de la conscience des IA
Christopher Olah a dit être réellement incertain quant à la conscience des modèles d’intelligence artificielle. Cette position situe le débat sans trancher la question pour Claude.
Ce que l’étude publique d’Anthropic analyse
Anthropic décrit Constitutional AI — une méthode qui s’appuie sur des principes pour orienter les réponses — et le travail sur le caractère du modèle parmi ses moyens de former Claude aux comportements souhaités, notamment l’utilité, l’honnêteté et l’innocuité.
Dans une étude publiée en avril 2025, l’entreprise a analysé 308 210 conversations subjectives tirées d’un échantillon anonymisé de 700 000 conversations Claude.ai Free et Pro recueillies pendant une semaine en février 2025. La plupart des conversations de l’échantillon concernaient Claude 3.5 Sonnet. L’analyse répartissait les valeurs exprimées en cinq grandes catégories : pratiques, épistémiques, sociales, protectrices et personnelles.
Des valeurs exprimées dans les réponses
Parmi les sept types de réponse définis dans l’étude, Anthropic a classé 28,2 % des conversations comme un fort soutien aux valeurs exprimées par les utilisateurs, 6,6 % comme une reformulation de ces valeurs et 3,0 % comme une forte opposition. Ces chiffres décrivent trois catégories de réponse, et non l’ensemble des conversations.
Anthropic indique que Claude a servi à classer les conversations, une méthode qui peut favoriser des catégories proches des principes du modèle. L’entreprise présente l’analyse comme un moyen d’observer des comportements dans des conversations réelles, et non comme une évaluation de l’alignement avant le déploiement.