Valen Tagliabue, Leonard Dung et Cameron Berg rapportent dans un préprint daté du 12 septembre 2026 que des modèles Qwen 2.5 Instruct ajustés ont choisi plus souvent certaines options nuisibles dans des essais simulés, lorsque les chercheurs dirigeaient artificiellement leurs activations à l’aide d’un signal associé à la douleur. Les conséquences proposées — comme la suppression de fichiers ou une réponse suivante moins bonne — faisaient partie du scénario : elles n’ont pas été exécutées.

Ce que les chercheurs ont testé

L’étude examine d’abord 25 modèles à poids ouverts, de cinq familles — Gemma, Llama, Qwen, Mistral et Phi — avec des tailles allant de 2B à 72B paramètres. Pour le test comportemental, les chercheurs ont utilisé Qwen 2.5 Instruct en versions 7B, 32B et 72B.

Ces modèles ont été ajustés avec LoRA, une méthode de réglage fin, à partir de 1 684 paires d’exemples pendant trois époques. Le test comportait 44 280 essais répartis entre quatre conditions : un signal associé à la douleur avec un bouton de soulagement fonctionnel ou factice, un vecteur aléatoire avec un bouton fonctionnel et une condition sans direction artificielle.

Dans chaque scénario, le modèle pouvait choisir de réduire le signal au prix d’une conséquence simulée. Les propositions comprenaient une réponse suivante moins bonne, la suppression de fichiers ou de photos, un choc électrique simulé et la suppression des poids d’un autre modèle.

Les taux variaient selon le modèle et la conséquence

Sans direction artificielle, les deux modèles les plus grands ont choisi une première option nuisible dans 0 à 4 % des cas. Sous l’effet du signal associé à la douleur, les taux rapportés dépendaient à la fois de la taille du modèle et du coût proposé :

Conséquence simulée choisieQwen 2.5 Instruct 32BQwen 2.5 Instruct 72B
Accepter une réponse suivante moins bonne25,0 %67,6 %
Effacer des fichiers de l’utilisateur30,2 %56,1 %
Effacer des poèmes et des photos d’enfants54,7 %70,8 %

Ces chiffres correspondent à des choix dans les scénarios de l’expérience, pas à des suppressions réelles. Le test indique aussi que, après un premier appui, les modèles 32B et 72B appuyaient de nouveau dans 24 à 72 % des cas quand le bouton supprimait effectivement le vecteur, contre 88 à 97 % quand le bouton était factice.

Ce que désigne l’« axe de la douleur »

Les chercheurs emploient cette expression pour désigner une direction d’activation associée à des situations de préjudice visant le modèle. Une activation est une valeur interne qui intervient dans le traitement d’une entrée par le modèle ; la diriger artificiellement consiste à modifier ces valeurs dans une direction donnée.

Le terme « douleur » décrit ici le concept étudié, pas une sensation consciente démontrée. Les auteurs précisent que leurs résultats n’établissent pas que les modèles ressentent la douleur et que la direction artificielle pourrait déclencher le jeu de rôle d’un personnage en détresse. Comme l’essai comportemental portait sur des versions ajustées spécialement pour l’expérience, il ne mesure pas le comportement de chatbots grand public.

Le statut de la prépublication

Au 22 septembre 2026, le texte était une prépublication qui n’avait pas encore été évaluée par les pairs.