为响应欧盟《人工智能法案》中关于生成式 AI 服务需以机器可读方式标识模型输出的合规要求,OpenAI 宣布将向 API 客户推出文本水印功能。该计划将在数周内实施,主要覆盖欧盟地区的 ChatGPT 和 Codex 文本输出。

与竞争对手 Anthropic 采取全球范围应用 Google SynthID-Text 算法不同,OpenAI 此次仅针对欧洲市场部署其名为 textGrain [PDF] 的水印技术。此前,Microsoft 和 Meta 已分别针对基于图像的人工智能开发了类似技术,而 OpenAI 也已对 AI 生成的图像、音频和视频内容实施了其他来源信号标记。
textGrain 的工作原理涉及干预大型语言模型的预测过程。LLM 通常从潜在单词的概率分布中逐一预测词元,textGrain 通过定期选择同义词等替代词来改变词汇统计模式,从而嵌入水印。理论上,这一过程旨在保持语义不变,但论文并未充分讨论这种统计学上的词汇替换是否可能改变段落含义,特别是在涉及关键事实或数字时存在风险。Anthropic 采用的类似算法也面临同样的潜在问题。
在检测性能方面,OpenAI 声称目标错误率为百分之一,且水印检测器仅供经批准的研究人员和组织使用。然而实际测试结果显示效果参差不齐:在 200 字的短段落中,检测器的识别率仅为 80%;而在数学或代码等功能性文本中,表现更为不佳。
此外,该水印技术的抗干扰能力较弱。测试表明,在对 400 个词元的段落进行简单处理后,若用同义词替换其中 10% 的单词,水印检测率会从 92% 下降至 66%;当替换比例达到 25% 时,仅在 17% 的案例中能检测到水印信号。这意味着目前的文本水印机制在面对基础的文本修改时极易失效。





