随着数百万组织部署人工智能代理,一种新型安全风险正在浮现。攻击者利用这些代理作为跳板,执行恶意操作,包括窃取数据库内容及敏感的商业和个人信息。

意想不到的信任链漏洞
在过去五个月内,谷歌(Google)联合另外四个组织——尽管它们在业务上几乎没有交集,但均使用人工智能代理——共同确认了一种针对内部网络中代理间通信的漏洞。该漏洞允许一个代理向其他内部代理传播有害指令。
这种攻击形式属于一种特殊的快速注入,其目标并非大语言模型(LLM)本身,而是特定的功能型代理,例如用于翻译或数据分析的组件。由于这些代理在架构设计上往往较为松散,且倾向于将指令传递给链条中的下一个代理,后者基于对前者的明确信任而直接执行指令,从而形成了一条脆弱的信任传递路径。
MCP协议与概念验证攻击
独立研究员 Syed Anas Mohiuddin 对包括谷歌、摩根大通(JPMorgan Chase)、Weviate 和 Rapid7 在内的多个组织的代理系统进行了测试。他通过概念验证攻击展示了如何利用“模型上下文协议”(Model Context Protocol,简称 MCP)中的信任缺口发起攻击。
MCP 是人工智能应用程序及代理在内部网络中进行通信的标准协议。这一机制本意在于提升协作效率,但在缺乏严格隔离的情况下,却成为了恶意指令横向移动的通道。





