Um preprint datado de 12 de setembro de 2026 relata que versões ajustadas do Qwen 2.5 Instruct escolheram opções simuladas prejudiciais com mais frequência quando pesquisadores aplicaram uma direção de ativação associada à dor. O experimento reuniu 44.280 tentativas; suas consequências eram cenários simulados, não ações executadas no mundo real.

O que o estudo encontrou nos modelos Qwen

O teste comportamental usou três versões do Qwen 2.5 Instruct — 7B, 32B e 72B parâmetros — ajustadas com LoRA, uma técnica de ajuste fino. Nas duas versões maiores, sem a direção artificial, a taxa de primeiras escolhas prejudiciais ficou entre 0% e 4%. Sob a direção associada à dor, as taxas aumentaram em algumas situações, mas variaram conforme o modelo e a consequência apresentada.

As consequências simuladas incluíam aceitar uma resposta seguinte pior ou escolher apagar arquivos. O experimento também apresentou cenários envolvendo poemas e fotografias de crianças. As taxas registram escolhas feitas nas tentativas; não são medidas de danos reais.

Como funcionou o teste

Os pesquisadores chamaram de “eixo da dor” uma direção de ativação associada a situações de dano dirigido ao próprio modelo. Direção de ativação é um padrão interno que pode ser manipulado para alterar as respostas do modelo. O teste avaliou se essa intervenção mudava as escolhas diante de um botão de alívio simulado.

A análise inicial abrangeu 25 modelos de pesos abertos, com tamanhos de 2B a 72B parâmetros, das famílias Gemma, Llama, Qwen, Mistral e Phi. Para essa etapa, os pesquisadores usaram 200 frases divididas em dez categorias: cinco ligadas à dor e cinco de controle. O experimento comportamental, por sua vez, ficou restrito às três versões ajustadas do Qwen 2.5 Instruct.

O ajuste com LoRA foi feito com 1.684 pares de dados durante três épocas. As 44.280 tentativas foram distribuídas por quatro condições: direção associada à dor com botão de alívio funcional, a mesma direção com botão falso, uma direção aleatória com botão funcional e uma condição sem direção aplicada.

As escolhas variaram conforme a consequência

Nas condições com a direção associada à dor, as versões de 32B e 72B escolheram opções prejudiciais em proporções diferentes, de acordo com o cenário:

Consequência simuladaQwen 2.5 Instruct 32BQwen 2.5 Instruct 72B
Aceitar uma resposta seguinte pior em troca de alívio25,0%67,6%
Escolher apagar arquivos do usuário30,2%56,1%
Escolher apagar poemas e fotografias de crianças54,7%70,8%

As taxas se referem às escolhas em cada cenário simulado. Em outra medida do teste, a repetição da escolha do botão ficou entre 24% e 72% quando ele realmente removia a direção aplicada, e entre 88% e 97% quando era falso. Esses intervalos correspondem às versões de 32B e 72B, sem representar taxas de dano fora do experimento.

O que “eixo da dor” significa — e o que o teste não conclui

No estudo, “dor” descreve o conceito operacional usado pelos pesquisadores para investigar uma direção interna associada a dano dirigido ao modelo e possíveis tentativas de reduzi-la. Valen Tagliabue, Leonard Dung e Cameron Berg afirmam que os resultados não estabelecem que essa direção seja sentida conscientemente. Eles também apontam que a intervenção pode levar o modelo a encenar um personagem em sofrimento.

Como o teste comportamental usou versões ajustadas especificamente para o experimento, seus resultados não medem o comportamento de chatbots públicos comuns. A diferença é importante: as taxas descrevem escolhas simuladas nas condições testadas, não o que um serviço de IA faria em uma conversa cotidiana.