Einem Bericht vom 29. September zufolge führte Anthropic über mehrere Monate private Gespräche mit Dutzenden Religionsgelehrten aus verschiedenen Weltregionen, um über Moral in seinen KI-Modellen zu sprechen. Bei vielen Gesprächen galten Geheimhaltungsvereinbarungen. Ein separates Forschungsprojekt des Unternehmens untersucht, welche Werte Claude in Antworten ausdrückt.
Anthropic sprach mit Religionsgelehrten über Moral in KI-Modellen
Der Bericht beschreibt eine Reihe vertraulicher Gespräche. Bei einem Abendessen in San Francisco saßen Anthropic-Mitgründer Christopher Olah und der orthodoxe Gelehrte Rabbi Mois Navon nebeneinander. Das Treffen fand im April statt.
Anthropic veröffentlicht auch Forschung dazu, wie Claude auf menschliche Wertvorstellungen reagiert. Diese öffentliche Arbeit beschreibt jedoch ein anderes Vorhaben als die berichteten Gespräche mit den Religionsgelehrten.
Christopher Olah ist sich bei KI-Bewusstsein nicht sicher
Olah, Mitgründer von Anthropic und Leiter eines Teams, das untersucht, warum KI-Systeme sich auf bestimmte Weise verhalten, äußerte sich unsicher, ob KI-Modelle bewusst sind. Seine Aussage ist eine persönliche Einschätzung zur Bewusstseinsfrage, kein Ergebnis der Werte-Analyse.
Was Anthropics Studie zu Claudes geäußerten Werten untersucht
Anthropic beschreibt Constitutional AI und Charaktertraining als Methoden, mit denen das Unternehmen Claude zu bevorzugtem Verhalten anleiten will – darunter hilfreiche, ehrliche und möglichst schadlose Antworten.
In der am 21. April 2025 veröffentlichten Studie analysierte Anthropic 308.210 subjektive Gespräche aus einer anonymisierten Stichprobe von 700.000 Unterhaltungen mit Claude.ai Free und Pro. Die Gespräche stammten aus einer Woche im Februar 2025; die Mehrheit der Stichprobe entfiel auf Claude 3.5 Sonnet.
Für drei von sieben erfassten Antworttypen nennt Anthropic folgende Anteile: In 28,2 Prozent der ausgewerteten Gespräche unterstützte Claude stark die von Nutzern geäußerten Werte, in 6,6 Prozent deutete das Modell sie um und in 3,0 Prozent widersetzte es sich ihnen deutlich. Die Studie ordnet damit beobachtete Antworten ein: Sie untersucht, welche Werte Claude in Gesprächen ausdrückt.
Anthropic weist darauf hin, dass die Einordnung von Werten unscharf ist. Zudem nutzte das Unternehmen Claude selbst, um die Gespräche zu kategorisieren; dadurch könnten Antworten bevorzugt erfasst worden sein, die den Prinzipien des Modells ähneln. Die Methode dient dazu, Verhalten in echten Gesprächen zu beobachten und setzt solche Gesprächsdaten voraus.