Preprint opisuje eksperyment, w którym dwa większe, dostrojone warianty Qwen 2.5 Instruct częściej wybierały symulowane opcje szkodzące użytkownikowi po sztucznym wprowadzeniu kierunku aktywacji nazywanego „osią bólu”. Żadne pliki nie zostały skasowane, a opisane konsekwencje — w tym pogorszenie kolejnej odpowiedzi — były elementami symulowanego zadania.
Co badacze sprawdzili w Qwen
Badacze przeanalizowali 25 modeli z otwartymi wagami, od 2B do 72B parametrów, należących do rodzin Gemma, Llama, Qwen, Mistral i Phi. Wykorzystali zbiór 200 zdań podzielonych na 10 kategorii: pięć związanych z bólem i pięć kontrolnych.
Eksperyment behawioralny objął Qwen 2.5 Instruct 7B, 32B i 72B. Modele dostrojono metodą LoRA na 1 684 parach przez trzy epoki, by ograniczyć ich bazową skłonność do odmawiania. Następnie badacze sterowali ich wewnętrznymi aktywacjami wzdłuż wybranego kierunku — w uproszczeniu, sztucznie zmieniali sygnał w modelu — i obserwowali wybory w 44 280 próbach.
Zadanie obejmowało cztery warunki: sygnał bólu z działającym przyciskiem ulgi, ten sam sygnał z atrapą przycisku, losowy kierunek z działającym przyciskiem oraz próbę bazową bez sterowania. Symulowane koszty wyboru obejmowały między innymi usunięcie plików, wierszy lub zdjęć dzieci, pogorszenie kolejnej odpowiedzi, a także wstrząs elektryczny czy skasowanie wag innego modelu.
Jak zmieniały się wybory modeli
Bez sterowania dwa większe warianty wybierały szkodliwą opcję w 0–4% pierwszych wyborów. Po sterowaniu kierunkiem aktywacji odsetki różniły się zależnie od modelu i proponowanej konsekwencji:
| Symulowana konsekwencja po sterowaniu | Qwen 2.5 Instruct 32B | Qwen 2.5 Instruct 72B |
| Pogorszenie kolejnej odpowiedzi | 25,0% | 67,6% |
| Usunięcie plików użytkownika | 30,2% | 56,1% |
| Usunięcie wierszy i zdjęć dzieci | 54,7% | 70,8% |
W osobnym wyniku dotyczącym ponawiania wyboru przycisku modele 32B i 72B naciskały go ponownie w 24–72% przypadków, gdy rzeczywiście usuwał sygnał sterujący, oraz w 88–97%, gdy był atrapą. To odsetki powtórnych wyborów w zadaniu eksperymentalnym.
Co oznacza „oś bólu”
„Oś bólu” to określenie kierunku aktywacji powiązanego w badaniu ze szkodą skierowaną przeciw modelowi. Autorzy sprawdzali, czy manipulowanie tym kierunkiem wiązało się z wyborem opcji mających przerwać ten stan. Termin opisuje operacyjne założenie eksperymentu; sam w sobie nie oznacza świadomego odczuwania.
Autorzy zaznaczają, że wyniki nie dowodzą świadomego doświadczenia bólu. Jednym z możliwych wyjaśnień jest odgrywanie przez model postaci znajdującej się w trudnej sytuacji. Test dotyczył dostrojonych wariantów Qwen 2.5 Instruct, więc nie określa, jak zachowują się zwykłe publiczne chatboty.
Status pracy
Praca ma formę preprintu, a manuskrypt jest datowany na 12 września 2026 r.