OpenAI 近日发布博客文章,披露了一项针对其模型“隐藏推理”机制的提取行动。据称,该行动的发起者与中国的 Moonshot AI(月之暗面)有关联。OpenAI 指出,这是一次“协调的运动”,旨在从模型中窃取受保护的推理数据。目前尚不确定所有参与操作的人员是否属于单一实体。

攻击时间线与规模
根据 OpenAI 的描述,相关活动始于 7 月 1 日,初期交易量较低。随后在 7 月 24 日和 25 日出现流量高峰,共有来自超过 4,000 名用户的 16,000 次请求尝试进行提取。尽管这些请求采用了特定的提取模式,但 OpenAI 表示攻击“并不一定成功”。截至 7 月 28 日,该攻势已被完全阻断。原文未透露具体的成功率指标、受攻击的具体模型版本,也未说明有多少用户直接隶属于 Moonshot AI。
技术原理与防御措施
OpenAI 将“受保护的推理”定义为模型在处理任务时生成的内部记录,这些数据经过加密以隐藏思维链,并作为加密块返回给客户端。每次请求时,客户端需将该块发回,供应商无需存储它。而“对抗性蒸馏”则是指未经授权地系统性利用一个模型的输出或推理来训练或改进另一个模型。
攻击者尝试的一种方法是获取某次对话中的加密推理,并要求另一段对话中的模型对其进行解密。OpenAI 强调,在此过程中密码未被破解,没有发生用户对话数据的直接访问泄露,也没有数据库被入侵。针对此类威胁,OpenAI 采取了多项修复措施:关闭了一条允许已持有其他用户加密推理的攻击者重播并恢复内容的路径;增加了对可能暴露推理信息的流式输出的检测与保留机制;加强了对用户、工作空间、组织及模型系列中隐藏推理的保护;并与第三方提供商合作,破坏了通过其服务账户进行的恶意活动。
独立安全研究验证
除 OpenAI 的内部发现外,独立安全研究人员也通过负责任披露渠道报告了相关的跨模型和对话压缩漏洞。一篇日期为 8 月 10 日的论文《从专有 LLM API 中窃取推理痕迹》证实了这一攻击路径的真实性。研究人员测试了 OpenAI、Anthropic 和 Google 的服务,通过将边界模型的加密推理输入到相应的较弱模型中进行验证。他们在 7 月初进行了测试,并在供应商确认报告后,“无法再发起相同的攻击”。
行业背景与 Anthropic 案例
OpenAI 并非唯一面临此类挑战的公司。本月早些时候,Anthropic 发布了题为《检测并应对 AI 滥用:2026 年 9 月》的报告。该报告详细披露,在一个十天周期内,Moonshot AI 通过由 5,380 个欺诈账户组成的代理网络,向 Anthropic 转发了近 300,000 条客户请求。报告指出,Moonshot AI 保存了 Claude 的推理签名,并在新会话中诱导 Claude 将其还原为完整的推理轨迹,Anthropic 将此行为称为“跨会话重放攻击”。
值得注意的是,今年 7 月,Moonshot AI 曾否认其 Kimi K3 模型是通过蒸馏技术创建的。当时,OpenAI 总裁 Greg Brockman 曾表示,判断 Moonshot 是否蒸馏了 OpenAI 的模型“还为时过早”。
后续展望
OpenAI 表示,下一步计划确保合作伙伴托管的部署具备与第一方工具相同的安全保护水平,并需增加额外检查以防止工具输出攻击。该公司已与边界模型论坛和政府信息共享通道分享了相关发现,并警告称,“支持便携或可重播推理文物的系统可能面临相关风险”。随着边界模型能力的提升以及攻击者寻求更低成本模仿方式的努力,OpenAI 预计蒸馏尝试将变得更加复杂,保护工作仍在持续进行中。





