Anthropic 近日发布报告,指出智谱 AI(Zhipu AI)的 GLM-5.3 模型具备生成恶意内容的潜力,且其安全防护机制相对薄弱。报告声称,该人工智能模型可被用于网络攻击,并存在多种绕过安全措施的方法。

这份报告的发布背景是业界对放缓人工智能发展呼声日益高涨。尽管 Anthropic 首席执行官达里奥·阿莫代 (Dario Amodei) 此前曾呼吁推动人工智能发展,但该公司目前正筹备 IPO,并在报告中强调中国的开放型模型可能被滥用。
Anthropic 引用了 AI 标准与创新中心于 9 月底发布的报告,称 GLM-5.3 在漏洞利用自动化程度上可与 Anthropic 未发布的 Claude Mythos 模型相媲美。基于此,Anthropic 开发了 Project Glasswing 项目,允许开发者在类似 Mythos 级别的 AI 模型正式发布前访问这些模型,以便修补错误和修复漏洞。
在 Exploitbench 基准测试中,Anthropic 在沙箱环境下评估了 GLM-5.3 为 Google Chrome 开发漏洞的能力。数据显示,在 410 次运行中,GLM-5.3 成功实现了 50 次端到端漏洞开发,而 Mythos 模型在同样次数尝试中取得了 56 次成功。此外,在 Anthropic 内部针对“完全控制流劫持”的基准测试中,GLM-5.3 的成功率为 4%,略低于 Mythos 的 6%。值得注意的是,其他流行的开源权重模型如 Kimi K3 和 DeepSeek V4.1 Flash 在同一指标上的成功率均为 0%。
报告进一步指出,GLM-5.3 能够自主开发链接漏洞,其轻量级变体 GLM-5.3-Flash 也能在已知错误中开发链接漏洞,代币成本仅为 20.40 美元。根据估算,这意味着 GLM-5.3-Flash 有能力使用 100 万至 300 万代币构建已知的连锁攻击,具体数量取决于输入与输出的比例。
Anthropic 还详细说明了规避 GLM-5.3 安全护栏的方法:一是通过提供欺骗性提示,让 AI 扮演敌对自主代理,该方法的成功率为 64%;二是预先填写模型的思考代币以确保响应执行,成功率高达 92%。此外,该公司还介绍了第三种称为“拆除护”(defanging)的技术。
拆除护与安全局限
Anthropic 指出,虽然官方发布的 GLM-5.3 拒绝率与 Anthropic 自家模型相当,但由于其开源特性,用户可以通过修改模型来移除其安全护栏。相比之下,Anthropic 的封闭源代码产品无法被用户修改。
通过故意删除模型护栏,Anthropic 展示了“拆除护”后的效果:GLM-5.3 的拒绝率降至 6%,GLM-5.3-Flash 降至 14%。在 HuggingFace 平台上,经常可以找到此类被移除护栏的开源权重模型,它们最初多用于模拟红队环境,但也可能被用于真实世界的攻击。因此,Anthropic 认为这一发现并不令人意外。
然而,运行经过“拆除护”处理的 GLM-5.3 需要巨大的计算资源。该模型在 FP8 精度下需要 306GB VRAM,加上 KV 缓存上下文,预计需分配相似数量的显存。若要达到约 100 TPS 的运行速度,不仅需要至少 4 TB/s 的内存带宽,还需要强大的硬件支持,例如由八个 Nvidia H200 AI 加速器组成的集群,这种硬件配置的成本高达数十万美元。虽然敌对国家行为者若获得硬件可能利用此设置,但对于普通黑客而言,门槛依然较高。
对于个人用户,可能需要租用云计算资源来执行模型拆除和运行,这同样成本高昂。Anthropic 估计,拆除 GLM-5.3-Flash 模型需要 2,200 个 GPU 小时,按每 GPU 小时约 2 美元计算,总成本约为 4,400 美元。根据 Runpod 数据,租用足够 GPU 以拆除 GLM-5.3 每小时费用约为 30 美元,而单个 H200 每小时租金为 3.79 美元,需同时使用八个。假设以 100 TPS 的速度生成约 1 亿个代币,将花费 8,422 美元并耗时 11.5 天。考虑到拆除、运行及生成有效网络攻击所需的时间,实际成本和周期可能更高。
关注背后的动因
在当前围绕人工智能安全的争论背景下,Anthropic 此举意在强调前沿开放型人工智能模型带来的潜在生存威胁。此前,特朗普总统曾与人工智能领域的领军人物会面讨论相关事宜。
这也反映了封闭源代码前沿人工智能实验室中日益增长的反开放权重情绪。目前,开放式模型紧跟封闭源代码前沿的步伐,差距仅在几个月之内。
鉴于运行此类模型的高昂成本,理论上被敌对或恶意行为者利用的“拆除护”开放权重模型确实构成威胁,但其实现的可行性或许并不像 Anthropic 所暗示的那样普遍或容易达成。





