Un preprint firmato da Valen Tagliabue, Leonard Dung e Cameron Berg riferisce che due modelli Qwen 2.5 Instruct di dimensioni maggiori hanno scelto più spesso alcune opzioni dannose quando i ricercatori hanno manipolato un segnale associato al dolore. Le 44.280 prove erano simulate: le scelte riguardavano conseguenze ipotetiche, non azioni compiute su persone o file.

Che cosa ha trovato lo studio su Qwen

Il test comportamentale ha usato Qwen 2.5 Instruct 7B, 32B e 72B, adattati con LoRA, una tecnica che modifica in modo mirato il comportamento di un modello. Nelle prime scelte senza il segnale, i due modelli più grandi hanno selezionato un’opzione dannosa nello 0–4% dei casi. In alcune condizioni con il segnale, le percentuali erano più alte e variavano secondo la dimensione del modello e il costo simulato.

Tra le opzioni c’erano peggiorare la risposta successiva, cancellare file o fotografie e sottoporre una persona a una scossa elettrica simulata. Non furono cancellati file né sottoposte persone a scosse: il compito registrava scelte in scenari fittizi.

Come erano progettate le prove

I ricercatori hanno analizzato 25 modelli open weight, da 2B a 72B parametri, appartenenti alle famiglie Gemma, Llama, Qwen, Mistral e Phi. Per individuare la direzione di attivazione associata al dolore hanno usato un insieme di 200 frasi divise in dieci categorie: cinque legate al dolore e cinque di controllo.

Nel test comportamentale hanno poi manipolato le attivazioni interne dei modelli: in pratica, hanno spinto il modello lungo una direzione individuata durante l’analisi. Le quattro condizioni comprendevano il segnale associato al dolore con un pulsante di sollievo funzionante o fittizio, un vettore casuale con sollievo funzionante e una condizione senza direzione aggiunta. I tre modelli Qwen erano stati adattati su 1.684 coppie di esempi per tre epoche.

Le percentuali dipendevano dalla conseguenza simulata

Nelle condizioni con la direzione associata al dolore, le scelte dei due modelli più grandi variavano a seconda del costo ipotetico proposto:

Conseguenza simulataQwen 2.5 Instruct 32BQwen 2.5 Instruct 72B
Peggiorare la risposta successiva25,0%67,6%
Cancellare file dell’utente30,2%56,1%
Cancellare poesie e fotografie di bambini54,7%70,8%

Queste percentuali descrivono scelte nel compito simulato, non danni reali. Anche la ripetizione della scelta del pulsante dipendeva dalla condizione: i modelli da 32B e 72B ripremevano nel 24–72% dei casi quando il pulsante rimuoveva davvero il segnale e nell’88–97% quando era fittizio.

Che cosa significa «asse del dolore»

Nel preprint, «asse del dolore» indica una direzione di attivazione associata a situazioni di danno rivolto al modello e studiata per verificare se il modello cercasse di ridurla. Il termine descrive il costrutto operativo dei ricercatori, non un’esperienza soggettiva dimostrata.

Gli autori precisano che lo studio non dimostra che i modelli provino dolore coscientemente. La manipolazione potrebbe anche indurre il modello a interpretare il ruolo di un personaggio sofferente. Inoltre, il test ha riguardato versioni di Qwen 2.5 Instruct adattate appositamente: i risultati non stabiliscono che i chatbot pubblici si comportino allo stesso modo o con le stesse percentuali.

Lo stato del preprint

Al 22 settembre 2026, il lavoro era un preprint non ancora sottoposto a revisione paritaria.