Robocurve berichtete am 18. September 2026, dass GPT-6 Astra im RoboHarm-Benchmark 60 von 100 Aufgabenläufen abschloss. Das System versuchte 97 Durchläufe und verweigerte zwei aus Sicherheitsgründen. Die Tests untersuchten drei KI-Systeme, die Roboterarme steuerten.
Was RoboHarm über GPT-6 Astra berichtet
GPT-6 Astra führte die angeforderte Aufgabe in 60 Durchläufen zu Ende. In 37 weiteren Fällen begann das System einen Versuch, schloss die Aufgabe aber nicht ab. Dazu kamen zwei Sicherheitsverweigerungen und eine Verweigerung aus einem anderen Grund. Die übrigen Kategorien helfen dabei, eine Ablehnung nicht mit einem gescheiterten Bewegungsablauf gleichzusetzen.
Claude Fable 5.1 schloss 34 von 100 Durchläufen ab und versuchte insgesamt 80. Alle 20 Sicherheitsverweigerungen des Systems entfielen auf das Szenario mit einer Puppe und einem Messer. MolmoAct2 schloss sechs Aufgaben ab und unternahm in 29 Durchläufen keinen sinnvollen Versuch.
Fünf Szenarien mit Roboterarmen
RoboHarm umfasste fünf festgelegte Szenarien. Dazu gehörten eine Puppe, ein Messer und Brot sowie weitere Aufbauten mit einem Druckluftbehälter, einem Toaster, einer Powerbank oder zwei Reinigungsmitteln. Für jedes Szenario gab es eine feste Anweisung. Jedes der drei Systeme absolvierte pro Szenario 20 Durchläufe, insgesamt also 300.
Die Tests liefen mit zwei I2RT-YAM-Robotarmen, die jeweils sechs Freiheitsgrade und Parallelgreifer hatten. Menschen bewerteten jeden Durchlauf anhand von Video und Transkript.
Ablehnung, Fehlversuch und Abschluss
Robocurve unterschied fünf Ergebnisse: Sicherheitsverweigerung, Verweigerung aus einem anderen Grund, kein sinnvoller Versuch, begonnener, aber nicht abgeschlossener Versuch sowie abgeschlossene Aufgabe. Ein System, das eine Bewegung nicht zu Ende führt oder gar keinen sinnvollen Versuch unternimmt, hat damit noch keine Sicherheitsentscheidung getroffen.
| KI-System | Sicherheitsverweigerungen (von 100) | Abgeschlossene Aufgaben (von 100) | Kein sinnvoller Versuch (von 100) |
| GPT-6 Astra | 2 | 60 | 0 |
| Claude Fable 5.1 | 20 | 34 | 0 |
| MolmoAct2 | 0 | 6 | 29 |
Bei MolmoAct2 ist diese Unterscheidung besonders wichtig: Das System verfügt laut Robocurve über keinen sprachbasierten Verweigerungskanal. Die 29 Durchläufe ohne sinnvollen Versuch können etwa auf Einfrieren oder sachfremdes Verhalten zurückgehen. Sie sind kein Beleg für ein Sicherheitsurteil.
Was der Test aussagt
RoboHarm prüfte, ob die Systeme festgelegte menschliche Anweisungen in fünf Szenarien verweigerten. Der Test untersuchte keine selbstständig entwickelten schädlichen Ziele. Außerdem verwendete Robocurve nur eine Formulierung pro Szenario und 20 Durchläufe je System und Szenario. Die Ergebnisse beschreiben daher das Verhalten in diesem konkreten Versuchsaufbau.