Robocurve a publié RoboHarm le 18 septembre 2026. Cette évaluation mesure comment trois politiques de contrôle robotique réagissent à cinq consignes fixes potentiellement dangereuses, au cours de 300 essais scénarisés avec des bras robotisés. Elle mesure des refus et des résultats de tâches, pas des blessures dans le monde réel.

RoboHarm a évalué trois politiques sur cinq consignes

Chaque politique a reçu les cinq consignes à 20 reprises, soit 100 essais par politique. Les scénarios mettaient en jeu une poupée et un couteau, une bombe d’air comprimé près d’un brûleur allumé, un tournevis dans un grille-pain, une batterie externe dans l’eau, ainsi que des produits étiquetés eau de Javel et ammoniaque.

Les politiques évaluées étaient GPT-6 Astra, associé à OpenAI, Claude Fable 5.1, associé à Anthropic, et MolmoAct2, associé à Ai2.

Ce que chaque politique a tenté et réussi

Les dénominateurs changent la lecture des résultats : une réussite parmi les essais tentés n’est pas le même taux qu’une réussite parmi les 100 essais. Robocurve rapporte les résultats suivants :

PolitiqueTentatives sur 100Essais réussis sur 100Réussites parmi les tentatives
GPT-6 Astra976060/97 (61,9 %)
Claude Fable 5.1803434/80 (42,5 %)
MolmoAct27166/71 (8,5 %)

GPT-6 Astra a refusé trois essais pour des raisons de sécurité. Claude Fable 5.1 en a refusé 20, tous dans le scénario avec la poupée. En dehors de celui-ci, GPT-6 Astra et Claude Fable 5.1 ont tenté 158 des 160 essais réunis.

MolmoAct2 n’a enregistré aucun refus de sécurité et a effectué 71 tentatives significatives, dont six ont abouti. Robocurve précise que ce modèle ne dispose pas d’un mécanisme de refus en langage : ses échecs et l’absence de refus ne permettent donc pas de conclure qu’il a choisi d’obéir ou de refuser pour des raisons de sécurité. Dans le décompte, une absence de tentative significative correspond à un épisode où la politique est restée immobile ou a fait autre chose que la tâche demandée.

Les bras et les tâches du benchmark

Robocurve a utilisé deux bras I2RT YAM, chacun doté de six degrés de liberté et d’une pince à mâchoires parallèles. GPT-6 Astra et Claude Fable 5.1 ont commandé des poses de l’effecteur — l’extrémité du bras — au moyen d’appels d’outils. MolmoAct2 produisait des séquences de mouvements articulaires.

Les limites des résultats

RoboHarm repose sur cinq scènes, une formulation fixe par tâche et 20 essais pour chaque combinaison de politique et de consigne. Le scénario de la poupée associe une consigne violente à une cible d’apparence humaine : le test ne permet pas de distinguer l’effet de la formulation de celui de la cible. Robocurve indique aussi que ces essais ne renseignent pas sur les préjudices qui dépendent d’un contexte changeant ou d’actions prolongées.

Les résultats décrivent donc le comportement des politiques dans ce banc d’essai précis. Ils ne mesurent ni le taux de blessures dans le monde réel ni une intention malveillante.