Il 29 settembre 2026 è emersa la notizia che Anthropic avrebbe tenuto per mesi incontri privati con decine di studiosi di religione per discutere come orientare i valori dei propri modelli di intelligenza artificiale. Molte conversazioni sarebbero state soggette a obblighi di riservatezza.

Tra gli appuntamenti descritti figura una cena a San Francisco in aprile, alla quale parteciparono il cofondatore di Anthropic Christopher Olah e lo studioso ortodosso Mois Navon.

Le consultazioni private di Anthropic

Gli incontri avrebbero coinvolto decine di studiosi di religione provenienti da diverse parti del mondo. Il resoconto pubblicato il 29 settembre 2026 descrive una serie di riunioni protratte per mesi; la cena di San Francisco è indicata come uno degli appuntamenti.

Christopher Olah si è detto incerto sulla coscienza dell’IA

Christopher Olah, cofondatore di Anthropic, ha dichiarato di essere sinceramente incerto sul fatto che i modelli di IA siano coscienti. La sua posizione esprime un dubbio, non una conclusione sulla coscienza di Claude.

Che cosa misura la ricerca pubblica di Anthropic

Anthropic descrive Constitutional AI e il training del carattere come metodi per orientare Claude verso comportamenti preferiti, tra cui essere utile, onesto e non dannoso.

Nel suo studio «Values in the wild», pubblicato il 21 aprile 2025, Anthropic ha analizzato 308.210 conversazioni soggettive selezionate da un campione di 700.000 conversazioni anonime di Claude.ai Free e Pro, raccolte durante una settimana del febbraio 2025. La maggior parte del campione riguardava Claude 3.5 Sonnet. L’analisi ha raggruppato i valori espressi in cinque categorie: pratici, epistemici, sociali, protettivi e personali.

Tra i sette tipi di risposta considerati, Anthropic ha classificato il 28,2% delle conversazioni come forte sostegno ai valori espressi dagli utenti, il 6,6% come riformulazione e il 3,0% come forte resistenza ai valori dell’utente.

I valori espressi nelle risposte

Lo studio descrive i valori che compaiono nelle risposte di Claude in conversazioni reali. Anthropic avverte che la classificazione dei valori è imperfetta e che l’uso di Claude per categorizzare le conversazioni può introdurre una distorsione a favore di comportamenti simili ai principi del modello.