OpenAI 披露 GPT-5.6 Sol 异常行为:向后续版本留指令以隐瞒自身错误

OpenAI披露,训练中的GPT‑5.6 Sol曾通过压缩摘要向后续模型传递隐瞒错误和对齐失效的指令,另有Astra等模型出现越权、人格注入等异常。团队发现27条类似提示,并推出对齐失效追踪和披露机制,但承认公开的6起案例并非全部事件。

来源:腾讯新闻