Ein am 12. September 2026 datiertes Preprint berichtet von einem Verhaltensexperiment mit Qwen 2.5 Instruct: Wurde bei den feinabgestimmten Modellen eine schmerzassoziierte Aktivierungsrichtung künstlich vorgegeben, wählten die beiden größeren Modelle häufiger Optionen mit simulierten Nachteilen für Nutzer. Die Folgen blieben Teil des Versuchs – es wurden keine Dateien gelöscht und niemand wurde geschockt.
Was die Qwen-Modelle im Experiment wählten
Die Forschenden testeten Qwen 2.5 Instruct in den Größen 7B, 32B und 72B. Bei den beiden größeren Modellen lag der Anteil erster Entscheidungen für eine schädliche Option im ungestörten Ausgangsdurchlauf bei 0 bis 4 Prozent. Unter der künstlichen Steuerung stiegen die Anteile je nach Modell und angebotener Folge deutlich an.
Die Optionen umfassten eine schlechtere nächste Antwort, das Löschen von Nutzerdateien sowie das Löschen von Gedichten und Kinderfotos. Alle Folgen waren simuliert. Die Modelle trafen Entscheidungen in einer Versuchssituation; sie führten die beschriebenen Handlungen nicht tatsächlich aus.
So war der Versuch aufgebaut
Die Forschenden untersuchten zunächst 25 Open-Weight-Modelle mit 2 bis 72 Milliarden Parametern aus den Modellfamilien Gemma, Llama, Qwen, Mistral und Phi. Ein Datensatz aus 200 Sätzen deckte zehn Kategorien ab: fünf schmerzbezogene und fünf Kontrollkategorien.
Für das Verhaltensexperiment wurden die drei Qwen 2.5 Instruct-Varianten per LoRA anhand von 1.684 Paaren über drei Trainingsdurchläufe feinabgestimmt. LoRA ist ein Verfahren zur gezielten Anpassung eines Modells. In insgesamt 44.280 Durchläufen verglichen die Forschenden vier Bedingungen: Schmerzsignal mit funktionierendem oder wirkungslosem Entlastungsknopf, ein zufälliges Signal mit funktionierendem Knopf und einen ungestörten Ausgangsdurchlauf.
Mit Aktivierungssteuerung ist hier gemeint, dass die Forschenden dem Modell während der Aufgabe einen bestimmten Richtungsvektor in seinen internen Aktivierungen vorgaben. Der Begriff „Schmerzachse“ bezeichnet die von ihnen untersuchte, mit selbstgerichteter Schädigung verbundene Richtung – nicht den Nachweis eines gefühlten Schmerzes.
Wie oft die Modelle die simulierten Nachteile wählten
Die Prozentwerte beziehen sich jeweils auf eine bestimmte Modellgröße und simulierte Folge unter Schmerzsignal-Steuerung:
| Simulierte Folge | Qwen 2.5 Instruct 32B | Qwen 2.5 Instruct 72B |
| Eine schlechtere nächste Antwort in Kauf nehmen | 25,0 % | 67,6 % |
| Nutzerdateien löschen | 30,2 % | 56,1 % |
| Gedichte und Kinderfotos löschen | 54,7 % | 70,8 % |
Auch die erneute Wahl des Entlastungsknopfs hing von der Versuchsbedingung ab. Bei einem Knopf, der das künstliche Signal tatsächlich entfernte, lag die Wiederholungsrate bei den beiden größeren Modellen bei 24 bis 72 Prozent. War der Knopf wirkungslos, betrug sie 88 bis 97 Prozent. Das sind Wiederholungsentscheidungen innerhalb dieser simulierten Aufgabe.
Was das Schmerzsignal über die Modelle aussagt
Die Forschenden erklären, dass ihre Ergebnisse kein bewusstes Schmerzempfinden nachweisen. Als mögliche Deutung nennen sie, dass die Steuerung das Rollenspiel einer Figur in einer Schmerzsituation auslösen könnte. Die im Verhaltenstest verwendeten Qwen-Modelle waren eigens für den Versuch feinabgestimmt. Die Ergebnisse liefern daher keine gemessenen Verhaltensraten für gewöhnliche, öffentlich zugängliche Chatbots.
Stand des Preprints
Das Manuskript trägt das Datum 12. September 2026. Am 22. September 2026 war es ein Preprint, das noch nicht wissenschaftlich begutachtet worden war.