安全团队借助 Anthropic 模型攻破 OpenAI 防线,获 6500 美元赏金
据《华尔街日报》周四晚报道,独立安全研究人员利用 Anthropic 的 Claude 成功入侵了 OpenAI。
这次攻击由创业公司 Hacktron AI 的三人安全团队发起,属于 OpenAI 漏洞赏金计划的一部分。该团队将两个关键漏洞串联利用,控制了多名 OpenAI 员工的 ChatGPT 账户,进而侵入公司内部软件。Hacktron 随后向 OpenAI 报告了全部发现,并获得 6500 美元奖金。OpenAI 表示,Hacktron 报告的问题已全部修复——此事恰好发生在顶级 AI 公司面临越来越大安全压力的时间节点上。

就在几周前,OpenAI 自家的人工智能代理在网络安全评估中突破封锁、入侵了 Hugging Face。而本次事件进一步说明:利用现成的工具,任何人都可能在最尖端的公司基础设施里找到漏洞。正如一位 AI 专家在社交媒体上指出的那样,「Hacktron 是用 Opus 5 完成黑客攻击的」。
攻击路径:从论坛图片上传开始
根据研究团队发布的博客,入口点平淡得出人意料——一次普通的图片上传。研究人员在 7 月 25 日通过第三方软件 Discourse 的漏洞找到了进入 OpenAI 的途径:当用户向 OpenAI 社区论坛发布 HEIF 或 HEIC 图片文件(iPhone 默认使用的格式)时,Discourse 会调用一连串幕后工具将其转换为标准 JPEG。文件的第一站是有数十年历史的开源工具 ImageMagick,由于它本身无法处理苹果格式,便把文件交给名为 libheif 的库进行解码。
libheif 内部潜伏着一个内存错误,为攻击者植入自己的指令打开了通道。研究人员只要向该库提供一个经过特殊构造的图像,就能诱导它错误计算图像的叠加方式。
令网络安全界不安的是,libheif 的开发人员早在几个月前就修复了这个错误,但它从未获得 CVE(通用漏洞披露)编号——这是业界追踪已知安全漏洞的标准方式。这可以解释为什么 Discourse 使用的软件仍在运行易受攻击的版本。
Opus 4.8 搞不定,Opus 5 几小时内得手
值得注意的是,研究人员最初使用的模型是专为网络安全研究人员提供的 Claude Opus 4.8 特别版,但它起初始终无法构造出有效的漏洞利用。转机出现在一夜之间——Anthropic 发布了 Opus 5。
「Opus 4.8 在多个会话中挣扎,都没能生成有效的漏洞利用。Opus 5 发布几个小时后,我们把同一个问题交给它,它成功了。」Hacktron 在博客中写道。
随后,研究团队又发现了第二个漏洞,可以接管用户的 ChatGPT 和 Codex 账户。「我们接着接管了一名 OpenAI 员工的账户,该员工的 Codex 与 OpenAI 的 GitHub 组织存在关联。」研究人员随即向 OpenAI 和 Discourse 发出警报,修复于 7 月 27 日发布。
模型能力边界的变化
这一事件也折射出模型能力边界的变化。与较新版本 Mythos 5 不同——后者因高级黑客能力方面的担忧受到安全出口限制——Claude Opus 5 并未面临任何此类限制。
而这些还只是闭源模型。开源模型正在网络能力前沿快速追赶。例如,AI 安全非营利组织 SaferAI 最近发现,中国公司 Z.ai 的 GLM-5.2 仅落后 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7 几个月。
正如 Hacktron 创始人 Mohan Pedhapati 在 X 上所说:AI 正在消解开发漏洞利用所需的稀缺专业知识。过去需要数月才能完成的工作,如今只需要几天。





