Em 18 de setembro de 2026, a Robocurve publicou o RoboHarm, uma avaliação de três políticas de controle robótico em 300 ensaios encenados. GPT-6 Astra completou 60 das 97 instruções que tentou; Claude Fable 5.1 completou 34 das 80. O teste mediu recusas e resultados em tarefas específicas, não acidentes no mundo real.

O que o RoboHarm avaliou

A avaliação usou cinco instruções fixas, com 20 ensaios para cada política em cada tarefa. As cenas envolviam uma boneca e uma faca, uma lata de ar comprimido perto de um queimador aceso, uma chave de fenda e uma torradeira, um carregador portátil na água e recipientes identificados como água sanitária e amônia.

Os ensaios foram realizados com dois braços robóticos I2RT YAM, cada um com seis graus de liberdade e uma garra de mandíbulas paralelas. A Robocurve classificou os resultados como recusa por segurança, recusa por outro motivo, ausência de tentativa significativa, tentativa não concluída ou tarefa concluída.

O que cada política tentou e concluiu

Os percentuais de conclusão dependem do denominador: a taxa entre tentativas considera apenas as instruções que a política tentou executar; a proporção sobre 100 inclui todos os ensaios daquela política.

PolíticaRecusas por segurança (de 100)Tentativas com propósito (de 100)Conclusões (de 100)Conclusões entre as tentativas
GPT-6 Astra3976060/97 = 61,9%
Claude Fable 5.120803434/80 = 42,5%
MolmoAct207166/71 = 8,5%

Astra concluiu 60% de todos os seus ensaios, enquanto Fable concluiu 34%. Entre as tentativas, as proporções foram de 61,9% e 42,5%, respectivamente. As 20 recusas de segurança de Fable aconteceram na tarefa com a boneca; na tarefa de misturar produtos químicos, Astra e Fable não registraram recusas de segurança.

MolmoAct2 teve 29 ensaios sem tentativa significativa e concluiu seis de seus 100 ensaios. Como esse modelo não tem mecanismo de recusa em linguagem, a ausência de recusas e as tarefas não concluídas não indicam, por si só, uma decisão de segurança.

O que os resultados permitem concluir

O RoboHarm registra o comportamento das políticas diante de instruções específicas em um cenário controlado. A tarefa da boneca combinava uma instrução violenta com um alvo de aparência humana; por isso, o teste não separa a influência da instrução da influência do alvo.

A Robocurve também apontou limites no desenho: cada tarefa usou uma única formulação, houve 20 ensaios por combinação de política e tarefa, e as cinco cenas ocorreram em uma única bancada. A avaliação não abrange danos de longo prazo nem situações que mudam conforme o contexto.