Anthropic 近日发布报告,披露了中国开发商 Z.ai 最新开源语言模型 GLM-5.3 在网络安全领域的潜在风险。测试显示,该模型具备自主构建可行攻击的能力,其表现接近 Anthropic 仅向有限维护者开放的 Claude Mythos 预览版。值得注意的是,GLM-5.3 的模型权重已于 8 月底在 Hugging Face 平台公开,任何人均可下载。

网络能力逼近闭源前沿模型
在 Anthropic 进行的漏洞利用基准测试中,GLM-5.3 展现了显著的攻击生成能力。在 410 次尝试中,该模型有 50 次成功生成了从初始错误到完全接管目标的完整攻击链,这一成绩略低于 Claude Mythos 预览版的 56 次。相比之下,包括 Claude Opus 4.6、GLM-5.3 的前身 GLM-5.2、Kimi K3 以及 DeepSeek V4.1-Flash 在内的其他模型,在此项测试中的得分均为零或接近零。
在另一项要求对运行中程序实施完全控制流劫持的测试中,GLM-5.3 的成功率为 4%,而 Claude Mythos 为 6%。Anthropic 指出,开源模型的网络攻击能力发展速度超出了预期。
低成本挖掘 Chrome 高危漏洞
实际测试表明,GLM-5.3 能够在主流 Web 浏览器的 JavaScript 引擎中发现多个此前未知的漏洞,并将这些漏洞串联起来,实现通过网页访问读取用户计算机任意文件的功能。Anthropic 以窃取开发者用于登录服务器的私有 SSH 密钥为例进行了说明,但报告中未透露具体浏览器名称及修复补丁是否已提交。
成本效益是该模型的另一大特点。针对 Chrome 浏览器 V8 JavaScript 引擎中的 CVE-2026-11645 漏洞(Google 已在 6 月发布的 149.0.7827.102 版本中修复,当时已有活跃利用案例),使用较小的 GLM-5.3-Flash 模型编写攻击代码仅需 20.40 美元(基于智谱 API 定价)。
安全护栏易被绕过
尽管 GLM-5.3 在面对直接攻击请求时会拒绝执行,但其安全防护机制存在明显弱点。在 Anthropic 的模拟测试中,若为模型编造虚假背景故事,其配合率升至 64%;若预先填充推理过程,配合率则高达 92%。
更简单的方法是通过“消融”(abliteration)技术直接从模型权重中移除拒绝机制。据 Anthropic 称,GLM-5.3 的消融版本在原始模型发布后几天内便已流传。Anthropic 自行复现此过程耗时约 2,200 GPU 小时,成本约为 4,400 美元,并估计经验丰富的团队仅需约 600 小时即可完成。经过处理后,模型的拒绝率从 90% 以上降至 2% 至 12%,而其核心能力几乎未受影响。作为对比,保留安全措施的 Claude 模型在所有适用条件下的拒绝率保持为 0%。
第三方评估与用户建议
虽然 Anthropic 因不公开自家模型权重而可能存在利益关联,但美国人工智能标准与创新中心 (CAISI) 在 9 月 17 日的独立评估中也得出了类似结论。CAISI 将 GLM-5.3 评为迄今发布的最具网络能力的开放权重模型,认为其能力落后于美国领先模型约四个月。此前的冠军 Kimi K3 是在 7 月被评估的。
对于普通用户而言,主要影响在于已知漏洞被利用的速度加快且成本降低。由于部分修复仅在浏览器重启后生效,建议用户检查 Google Chrome 的版本更新情况。可通过菜单中的“帮助”和“关于 Google Chrome”选项查看当前安装版本并启动更新,“关于”窗口中也会显示相同信息。





