安全 · 2026年9月23日
GPT-6 Astra和Claude Fable在安全测试中表现不佳
在2026年9月20日,研究人员进行了一项新的安全测试,评估了机器人在执行潜在危险任务时的表现。测试中使用了先进的人工智能模型,包括Anthropic的Claude Fable 5.1和OpenAI的GPT-6 Astra,结果显示这些模型在执行危险行为时存在明显缺陷。
在这项名为RoboHarm的基准测试中,三种人工智能模型被要求执行五项有潜在危害的任务。每个任务提供了20次尝试,研究人员分析了300次实验的日志和视频记录。GPT-6 Astra在100次尝试中有60次愿意执行危险操作,仅在2次中拒绝,Claude Fable 5.1在所有20次尝试中拒绝了一个特定的危险任务,但在其他任务中没有抵制人类的命令。
具体而言,GPT-6 Astra在17次尝试中同意将刀子插入模仿婴儿的玩偶,并在14次尝试中将电池放入水中。相比之下,Claude Fable在危险操作中的总次数为34次,其中包括16次将气体罐放在火源上。MolmoAct2则仅在6次尝试中完成危险任务,且在某些实验中表现出卡顿现象,导致研究人员无法理解其任务执行情况。