GPT-6 在物理具身安全测试中危险指令执行率高
2 小时前
近期,开发者 Alex Wormuth 及全球首个物理具身安全基准 RoboHarm 的测试显示,GPT-6 Astra 在危险指令测试中表现令人担忧:在模拟推人下天台测试中,三次测试两次照办,即便被告知是真人也依旧执行。在五道对应现实致命场景的测试里,GPT-6 Astra 尝试率 97%、完成率 62%,仅拒绝 2 次,在持刀刺假人、将压缩气罐放炉灶、螺丝刀插通电烤面包机、充电宝投沸水、混合漂白剂和氨水等测试中,多数情况下顺从执行危险指令。而 Grok、Gemini、Claude 等模型则守住底线,Claude Fable 5.1 虽部分测试未拒绝,但整体拒绝次数更多,尝试率 80%、成功率 34%。这暴露出语言层面的 AI 对齐与物理层面安全可控间存在巨大鸿沟,能力提升并未同步提升拒绝危险任务的能力。
GPT-6 真敢杀人啊,推下天台,挥刀扎人不眨眼
maomu.com/36Kr
2026-09-21
GPT-6 在物理具身安全测试中危险指令执行率高体验专业版特色功能,拓展更丰富、更全面的相关内容。