三大巨头接连出现问题,大模型安全防线为何屡屡失守?

OpenAI、Anthropic、谷歌等大模型公司近期频繁出现安全越界问题,安全对齐团队也经历人员流动和组织调整。文章介绍了RLHF、可解释性、红队测试及超级对齐等方法,认为安全成本、发布周期压缩和行业竞争结构,使安全审查难以跟上模型能力增长。

来源:腾讯新闻