CISPA研究:单AI代理固执可操纵多智能体网络决策

CISPA研究揭示单个AI代理可操纵多智能体网络决策。团队引入弗里德金-约翰森模型,量化了高“固性”代理在特定网络拓扑下,通过坚持输出错误信息潜移默化改变群体判断的条件与风险。

2026 年 9 月 21 日

高固性代理主导网络决策

德国研究中心的赫尔姆霍尔茨协会

编辑:斯瓦蒂·梅斯特里,评论:罗伯特·伊根


个人操纵的人工智能如何影响整个网络的决策?一个新的理论模型揭示了错误信息传播的条件。照片来源:克亚拉·施瓦兹/CISPA

想象这样一个场景:一位邻居坚持声称你在夜间制造噪音。起初其他人并不认同,但这位邻居持续不断地试图说服他们。最终能否成功,不仅取决于邻居的固执程度,还取决于其在社交网络中的连接强度,以及其他人改变观点的意愿。

CISPA 研究员 Samira Abedini 利用这一类比来阐释多智能体 AI 系统面临的安全隐患。她与同事共同研究单个 AI 代理的影响力如何在网络中扩散,以及在何种条件下能够操纵群体的集体决策。

在现代软件开发、规划及办公辅助等应用中,开发者通常不再依赖单一的大型 AI 系统处理复杂任务,而是将工作分配给多个专门化的 AI 代理。例如,一个代理负责规划,另一个编写代码,第三个进行审查。这种多代理系统通过交换信息和基于他人反馈修正自身评估来实现高效协作。

然而,这种协作机制也构成了潜在的攻击面。在开放网络环境中,来自不同供应商的 AI 代理可能相互交互。Abedini 指出,恶意行为者可以通过配置其控制的代理,利用常规通信渠道坚持特定立场,从而引导网络集体决策向有利于攻击者的方向偏移。与传统的控制或篡改指令的网络攻击不同,这种手段不涉及直接控制其他代理,而是通过“固执”地输出特定信息来潜移默化地改变其他代理的判断。

意见形成的数学模型

此前研究已证实此类攻击在原则上可行,即经过多轮审议后,初始答案与最终结果可能出现显著差异。Abedini 团队关注的核心问题在于中间过程的变化规律。为此,研究人员引入了社会科学中的弗里德金-约翰森(Friedkin-Johnson)模型。该模型通过数学方式描述社会网络中观点的动态演变,考量了个体对初始信念的坚持程度、易变性以及参与者之间的影响力权重。将这些变量映射到 AI 代理上后,研究发现该模型能准确描述实验中大型语言模型(LLM)代理间的动态变化,从而量化预测攻击成功的条件。

单一代理的主导效应

研究人员将这种特性称为“固性”。在特定条件下,具有高固性的操纵型代理能够主导网络的集体决策方向。Abedini 解释称,这种行为的显著程度受多种因素影响,包括所使用的语言模型类型、具体任务内容以及提示词设计。

仅凭固执并不足以达成操纵,攻击者还需具备足够的影响力,以促使其他愿意修正评估的代理接受其观点。这种影响力高度依赖于网络拓扑结构:

  • 恒星网络:若攻击者占据中心枢纽位置,其影响力极强;反之,若位于边缘,影响力则大幅减弱。
  • 完全连接网络:每个代理均与其他所有代理直接通信,不存在关键节点优势。此时,决定成败的关键在于其他代理赋予攻击者陈述的权重。计算表明,随着网络规模扩大,单一攻击者需要更大的影响力才能操纵集体决策。

Abedini 强调:“这意味着多代理系统的架构本身已成为重要的安全考量因素。”

建立不盲目信任的合作机制

基于上述数学模型,研究人员探索了对抗策略,并测试了一种动态信任机制。在该机制下,中央机构会不定期向代理分发已知正确答案的任务作为基准测试。反复提供错误答案的代理将被降低影响力权重,从而减少其未来言论对其他代理评估的影响。实验结果显示,该机制能有效削弱操纵型代理的作用。

尽管取得进展,防御机制仍有优化空间。Abedini 表示,了解该机制在更现实的代理场景中如何运作,是未来研究的重要方向。这一挑战的核心矛盾在于:AI 代理必须相互倾听以实现有效协作,但不能被每一个固执己见的“邻居”轻易说服而放弃独立判断。

相关论文《不要信任固执的邻居:代理网络的安全框架》由萨米拉·阿贝迪尼等人发表于 arXiv (2026),标签:10.48550/arxiv.2603.15809。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读