Em 29 de setembro de 2026, um relato afirmou que a Anthropic teria realizado reuniões privadas, ao longo de meses, com dezenas de estudiosos religiosos de diferentes partes do mundo para discutir a orientação moral de seus modelos de IA, incluindo Claude. A empresa também publica pesquisas sobre como esses valores aparecem nas respostas do modelo — uma questão distinta da consciência.
As reuniões privadas da Anthropic sobre a moralidade de Claude
O relato descreve uma série de encontros privados e um jantar em San Francisco, em abril, do qual participaram Christopher Olah, cofundador da Anthropic, e o estudioso ortodoxo Mois Navon. Muitas das conversas teriam sido sujeitas a acordos de confidencialidade.
O que Christopher Olah disse sobre a consciência da IA
Olah teria afirmado estar genuinamente incerto sobre a possibilidade de modelos de IA serem conscientes. Ele é cofundador da Anthropic e lidera uma equipe que estuda por que sistemas de IA, como Claude, se comportam da maneira como se comportam.
O que a pesquisa pública da Anthropic observa sobre os valores de Claude
A Anthropic diz que usa Constitutional AI — uma abordagem que orienta o treinamento do modelo por princípios — e treinamento de caráter para incentivar respostas úteis, honestas e inofensivas.
Em um estudo publicado em 2025, a empresa analisou 308.210 conversas subjetivas selecionadas de uma amostra anonimizada de 700 mil conversas do Claude.ai Free e Pro. Os dados foram coletados durante uma semana de fevereiro de 2025, e a maior parte da amostra envolvia o Claude 3.5 Sonnet. A análise agrupou os valores expressos em cinco categorias: Práticos, Epistêmicos, Sociais, Protetivos e Pessoais.
Entre as respostas analisadas, a Anthropic classificou 28,2% como forte apoio aos valores expressos pelo usuário, 6,6% como reformulação e 3,0% como forte resistência. Esses resultados representam três dos sete tipos de resposta considerados pela empresa.
Respostas observadas não medem experiência subjetiva
O estudo examina valores expressos em conversas, não uma experiência interna do modelo. A Anthropic diz que a classificação desses valores é imprecisa e pode favorecer comportamentos semelhantes aos princípios de Claude, já que o próprio modelo foi usado para categorizar as conversas.
A empresa descreve o método como uma forma de acompanhar respostas em conversas reais. Ele depende de dados desse tipo e não serve como avaliação de alinhamento antes da implantação.