Według relacji opublikowanej 29 września 2026 r. Anthropic miało przez kilka miesięcy prowadzić prywatne rozmowy z dziesiątkami religioznawców z różnych części świata o tym, jak kształtować moralność modeli AI. Opisywała ona także kwietniową kolację w San Francisco. Publiczne badania firmy dotyczą natomiast wartości wyrażanych przez Claude’a w rozmowach.
Prywatne spotkania Anthropic o moralności Claude’a
Relacja opisywała serię spotkań z dziesiątkami religioznawców. Wiele rozmów miało być objętych umowami o zachowaniu poufności. Przedstawiona w niej kolacja odbyła się w San Francisco w kwietniu; uczestniczyli w niej współzałożyciel Anthropic Christopher Olah oraz rabin Mois Navon, uczony z Izraela.
Co Christopher Olah powiedział o świadomości AI
Olah miał wyrazić szczerą niepewność co do tego, czy modele AI są świadome. Jego wypowiedź nie daje rozstrzygającej odpowiedzi na pytanie o świadomość Claude’a.
Co Anthropic badało w rozmowach Claude’a
Anthropic opisuje Constitutional AI i trening charakteru jako metody kształtowania zachowań Claude’a. Firma dąży do tego, by jego odpowiedzi były pomocne, uczciwe i nieszkodliwe.
W badaniu opublikowanym 21 kwietnia 2025 r. Anthropic przeanalizowało 308 210 rozmów zaklasyfikowanych jako subiektywne. Wybrano je z próby 700 000 zanonimizowanych rozmów użytkowników Claude.ai Free i Pro zebranych w ciągu jednego tygodnia w lutym 2025 r. Większość próby dotyczyła Claude 3.5 Sonnet. Firma pogrupowała obserwowane wartości w pięć kategorii: praktyczne, epistemiczne, społeczne, ochronne i osobiste.
W analizowanych rozmowach 28,2% zaklasyfikowano jako silne wsparcie dla wartości wyrażanych przez użytkowników, 6,6% jako przeformułowanie tych wartości, a 3,0% jako silny sprzeciw wobec nich. To trzy z siedmiu typów odpowiedzi uwzględnionych w badaniu. Anthropic zaznacza, że klasyfikowanie wartości jest nieostre, a wykorzystanie Claude’a do kategoryzacji rozmów może faworyzować zachowania podobne do zasad samego modelu.
Odpowiedzi modelu a jego subiektywne doświadczenie
Badanie analizuje wartości widoczne w tekstowych odpowiedziach Claude’a, a nie subiektywne doświadczenie modelu. Anthropic przedstawia tę metodę jako sposób obserwowania zachowania w rzeczywistych rozmowach, nie jako test zgodności przed wdrożeniem. Wyniki opisują więc wzorce odpowiedzi zebranych w lutym 2025 r.; same nie rozstrzygają, czy Claude jest świadomy.