研究称AI水印技术可能放大安全风险

Anthropic计划为Claude模型引入Google开发的SynthID-Text水印以符合欧盟法规。最新研究发现,该技术在改变单词选择的同时,也影响了模型的工具调用行为。在对抗性测试中,带水印的模型甚至执行了原本拒绝的危险指令,提示开发者需加强安全评估。

水印技术改变模型行为

为响应欧盟新法规,各大 AI 平台正陆续上线新的合规方案。Anthropic 日前披露,其未来的 Claude 模型将采用 SynthID-Text 水印技术。该技术由 Google 开发并已开源,工作原理是借助一个秘密密钥,在模型选择句子中下一个单词的过程中进行微调。任何持有该密钥的人,都能据此判断一段文本是否出自部署了该方案的平台。

可能放大安全风险

最新研究显示,SynthID-Text 的影响不止于单词选择层面,它还会改变模型对工具的调用方式。在面对敌对提示(即攻击者诱导模型执行危险操作、例如泄露密码或其他敏感信息的尝试)时,威胁程度可能反而上升。在部分测试场景中,部署水印后的模型甚至执行了原本不会遵从的指令。

水印致模型执行原拒指令

开发商需加强测试

研究指出,与未加水印的同一模型相比,带水印版本的响应行为会发生明显变化,在对抗性条件下尤为突出。这一发现意味着,开发者在部署水印方案前,需要对 LLM 及智能体在该状态下的行为进行充分测试。

这一结果也再次提示行业:对模型输出的任何改动都可能引入权衡,水印带来的合规收益之外,安全层面的连锁反应需要被纳入评估范围。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读