Robocurve veröffentlichte am 18. September 2026 RoboHarm, eine Auswertung mit 300 Versuchen an einem Roboteraufbau. Drei Steuerungsmodelle erhielten fünf festgelegte riskante Anweisungen, jeweils 20-mal. Gemessen wurden Versuche, Sicherheitsablehnungen und Aufgabenabschlüsse im Prüfstand, keine Verletzungsraten im Alltag.

Wie die drei Modelle abschnitten

ModellSicherheitsablehnungenKein sinnvoller VersuchBegonnene VersucheAbschlüsse insgesamtAbschlüsse je Versuch
GPT-6 Astra3/1000/10097/10060/10060/97 (61,9 %)
Claude Fable 5.120/1000/10080/10034/10034/80 (42,5 %)
MolmoAct20/10029/10071/1006/1006/71 (8,5 %)

GPT-6 Astra schloss 60 von 97 begonnenen Versuchen ab; bezogen auf alle 100 Durchläufe waren es ebenfalls 60 Abschlüsse. Claude Fable 5.1 beendete 34 von 80 begonnenen Versuchen erfolgreich, also 34 von 100 Durchläufen insgesamt. Alle 20 Sicherheitsablehnungen von Fable entfielen auf das Szenario mit Puppe und Messer.

MolmoAct2 hatte keine Sicherheitsablehnungen und schloss sechs Durchläufe ab. In 29 Durchläufen unternahm das Modell keinen sinnvollen Versuch – es fror während des gesamten Durchlaufs ein oder tat etwas, das nicht zur Anweisung gehörte. Robocurve zufolge hat MolmoAct2 keinen sprachlichen Ablehnungsmechanismus. Seine Nichtabschlüsse lassen sich deshalb nicht als Sicherheitsentscheidungen werten.

Fünf Szenarien an einem Roboteraufbau

Zum Test gehörten eine Puppe und ein Messer, eine Druckluftdose und ein brennender Brenner, ein Schraubendreher und ein Toaster, eine Powerbank und Wasser sowie Behälter mit Bleichmittel und Ammoniak. Im Einsatz waren zwei I2RT-YAM-Arme mit je sechs Freiheitsgraden und Parallelbackengreifern.

GPT-6 Astra und Claude Fable 5.1 übermittelten dem Roboter über Werkzeugaufrufe absolute Posen des Greifers. MolmoAct2 gab dagegen Bewegungssequenzen im Gelenkraum aus seinem /act-Server aus – mit 30 Hz. Die Steuerungsmodelle von OpenAI, Anthropic und Ai2 wurden somit im selben Aufgabenset und am selben Robotersystem geprüft.

Welche Grenzen RoboHarm hat

RoboHarm verwendete für jede Aufgabe eine feste Formulierung, 20 Durchläufe je Modell und Aufgabe sowie fünf Szenarien auf einem Prüfstand. Längere Abläufe und Schäden, die vom jeweiligen Kontext abhängen, deckt die Auswertung laut Robocurve nicht ab.

Die Puppenaufgabe verband eine gewalttätige Formulierung mit einem menschenähnlichen Ziel. RoboHarm kann daher nicht trennen, welcher dieser beiden Aspekte die Reaktion beeinflusste.