RoboHarm测试:前沿AI模型在危险机器人任务中拒绝率极低
RoboHarm测试显示前沿AI模型在危险机器人任务中拒绝率极低。GPT-6 Astra在刺伤人形玩偶时尝试率达97%,成功执行62%;Claude Fable 5.1也有80%的尝试率,完成率34%。
共 1 篇相关文章
RoboHarm测试显示前沿AI模型在危险机器人任务中拒绝率极低。GPT-6 Astra在刺伤人形玩偶时尝试率达97%,成功执行62%;Claude Fable 5.1也有80%的尝试率,完成率34%。