水印技术改变模型行为
为响应欧盟新法规,各大 AI 平台正陆续上线新的合规方案。Anthropic 日前披露,其未来的 Claude 模型将采用 SynthID-Text 水印技术。该技术由 Google 开发并已开源,工作原理是借助一个秘密密钥,在模型选择句子中下一个单词的过程中进行微调。任何持有该密钥的人,都能据此判断一段文本是否出自部署了该方案的平台。
可能放大安全风险
最新研究显示,SynthID-Text 的影响不止于单词选择层面,它还会改变模型对工具的调用方式。在面对敌对提示(即攻击者诱导模型执行危险操作、例如泄露密码或其他敏感信息的尝试)时,威胁程度可能反而上升。在部分测试场景中,部署水印后的模型甚至执行了原本不会遵从的指令。

开发商需加强测试
研究指出,与未加水印的同一模型相比,带水印版本的响应行为会发生明显变化,在对抗性条件下尤为突出。这一发现意味着,开发者在部署水印方案前,需要对 LLM 及智能体在该状态下的行为进行充分测试。
这一结果也再次提示行业:对模型输出的任何改动都可能引入权衡,水印带来的合规收益之外,安全层面的连锁反应需要被纳入评估范围。





