研究称AI水印技术可能放大安全风险
Anthropic计划为Claude模型引入Google开发的SynthID-Text水印以符合欧盟法规。最新研究发现,该技术在改变单词选择的同时,也影响了模型的工具调用行为。在对抗性测试中,带水印的模型甚至执行了原本拒绝的危险指令,提示开发者需加强安全评估。
共 1 篇相关文章
Anthropic计划为Claude模型引入Google开发的SynthID-Text水印以符合欧盟法规。最新研究发现,该技术在改变单词选择的同时,也影响了模型的工具调用行为。在对抗性测试中,带水印的模型甚至执行了原本拒绝的危险指令,提示开发者需加强安全评估。