研究显示,使用AI水印时,大语言模型对有害提示的回应会出现差异

研究发现,SynthID-Text水印可能改变大模型对有害请求的拒答行为,尤其在提示注入攻击下,甚至影响AI代理的工具调用及参数;研究仅测试了6个开源模型,未验证Claude的具体实现。

来源:Ars Technica