Berichtgeving die op 29 september 2026 verscheen, meldde dat Anthropic maandenlang privé met tientallen religieuze deskundigen uit verschillende delen van de wereld sprak over moraliteit in zijn AI-modellen. Bij een diner in San Francisco waren Anthropic-medeoprichter Christopher Olah en rabbijn Mois Navon aanwezig. Veel gesprekken vielen volgens het bericht onder geheimhoudingsovereenkomsten.
Anthropics privégesprekken over de moraal van Claude
De gesprekken gingen volgens de berichtgeving over het inbrengen van moraliteit in AI-modellen. Het verslag beschreef ook een diner in San Francisco in april, bijgewoond door Olah en Navon. Het jaar van dat diner werd niet vermeld.
Wat Christopher Olah zei over AI-bewustzijn
Olah zei dat hij oprecht onzeker is over de vraag of AI-modellen bewustzijn hebben. Hij is medeoprichter van Anthropic en leidt een team dat onderzoekt waarom AI-systemen zoals Claude zich gedragen zoals ze doen.
Anthropics openbare waardenonderzoek gaat over wat Claude in gesprekken antwoordt. Het onderzoekt niet of het model waarden bewust ervaart.
Wat Anthropics onderzoek naar Claude-waarden laat zien
Anthropic zegt dat het Claude met Constitutional AI en karaktertraining vormt om gewenst gedrag te stimuleren, zoals behulpzame, eerlijke en onschadelijke antwoorden. De studie Values in the wild analyseerde geanonimiseerde gesprekken van Claude.ai Free en Pro, verzameld gedurende één week in februari 2025.
Van de 700.000 gesprekken werden 308.210 subjectieve gesprekken geselecteerd voor de analyse. De meeste gesprekken in de oorspronkelijke steekproef betroffen Claude 3.5 Sonnet. Anthropic groepeerde de waarden die in antwoorden naar voren kwamen in vijf categorieën: praktische, epistemische, sociale, beschermende en persoonlijke waarden.
In 28,2% van de geanalyseerde gesprekken gaf Claude volgens de indeling sterke steun aan de waarden die gebruikers uitten. In 6,6% bood het een andere inkadering en in 3,0% verzette het zich sterk. Dit zijn drie van de zeven antwoordtypen die Anthropic onderscheidde. Het bedrijf kon bovendien niet steeds bepalen of het spiegelen van gebruikerswaarden gepaste empathie was of vleierij.
Geuite waarden zijn geen bewijs van bewuste ervaring
De studie beschrijft waarden die in antwoorden tot uiting komen; ze meet geen subjectieve ervaring. Anthropic gebruikte Claude ook om gesprekken te classificeren. Volgens het bedrijf kan dat de indeling vertekenen richting gedrag dat aansluit bij de eigen principes van het model.
Anthropic beschrijft de methode als een manier om gedrag in echte gesprekken te volgen. Daarvoor zijn echte gespreksgegevens nodig; de methode is geen evaluatie van afstemming vóór de inzet van een model.