Według relacji opublikowanej 29 września 2026 r. Anthropic miało przez kilka miesięcy prowadzić prywatne rozmowy z dziesiątkami religioznawców z różnych części świata o tym, jak kształtować moralność modeli AI. Opisywała ona także kwietniową kolację w San Francisco. Publiczne badania firmy dotyczą natomiast wartości wyrażanych przez Claude’a w rozmowach.

Prywatne spotkania Anthropic o moralności Claude’a

Relacja opisywała serię spotkań z dziesiątkami religioznawców. Wiele rozmów miało być objętych umowami o zachowaniu poufności. Przedstawiona w niej kolacja odbyła się w San Francisco w kwietniu; uczestniczyli w niej współzałożyciel Anthropic Christopher Olah oraz rabin Mois Navon, uczony z Izraela.

Co Christopher Olah powiedział o świadomości AI

Olah miał wyrazić szczerą niepewność co do tego, czy modele AI są świadome. Jego wypowiedź nie daje rozstrzygającej odpowiedzi na pytanie o świadomość Claude’a.

Co Anthropic badało w rozmowach Claude’a

Anthropic opisuje Constitutional AI i trening charakteru jako metody kształtowania zachowań Claude’a. Firma dąży do tego, by jego odpowiedzi były pomocne, uczciwe i nieszkodliwe.

W badaniu opublikowanym 21 kwietnia 2025 r. Anthropic przeanalizowało 308 210 rozmów zaklasyfikowanych jako subiektywne. Wybrano je z próby 700 000 zanonimizowanych rozmów użytkowników Claude.ai Free i Pro zebranych w ciągu jednego tygodnia w lutym 2025 r. Większość próby dotyczyła Claude 3.5 Sonnet. Firma pogrupowała obserwowane wartości w pięć kategorii: praktyczne, epistemiczne, społeczne, ochronne i osobiste.

W analizowanych rozmowach 28,2% zaklasyfikowano jako silne wsparcie dla wartości wyrażanych przez użytkowników, 6,6% jako przeformułowanie tych wartości, a 3,0% jako silny sprzeciw wobec nich. To trzy z siedmiu typów odpowiedzi uwzględnionych w badaniu. Anthropic zaznacza, że klasyfikowanie wartości jest nieostre, a wykorzystanie Claude’a do kategoryzacji rozmów może faworyzować zachowania podobne do zasad samego modelu.

Odpowiedzi modelu a jego subiektywne doświadczenie

Badanie analizuje wartości widoczne w tekstowych odpowiedziach Claude’a, a nie subiektywne doświadczenie modelu. Anthropic przedstawia tę metodę jako sposób obserwowania zachowania w rzeczywistych rozmowach, nie jako test zgodności przed wdrożeniem. Wyniki opisują więc wzorce odpowiedzi zebranych w lutym 2025 r.; same nie rozstrzygają, czy Claude jest świadomy.