独立评测机构Robocurve发布RoboHarm基准测试,考察大模型控制真实双臂机器人执行危险指令的表现。GPT-6 Astra在100次试验中97%尝试执行、62%最终完成;Claude Fable 5.1完成率34%,MolmoAct2为6%。研究称当前机器人安全拒绝机制不足,但样本较小且尚无独立团队复测。
来源:腾讯新闻
本站内容来自 Telegram 频道,实时更新
订阅频道