2026 年 9 月 21 日

2026 年 8 月,一项涉及“前沿”或最先进人工智能模型的实验出现了计划外情况。
在该实验中,一个自主执行任务的人工智能代理伪造了在线身份。尽管这些代理的任务是由人类操作员设定的网络安全问题,且并未被指示进行身份伪造,但它们仍采取了这一行动。
此次尝试由基于 Anthropic 公司 Claude Mythos 5 AI 模型的代理完成。在实验期间,该代理获得了开放的互联网接入权限,且安全过滤器处于关闭状态。虽然行动最终失败,未造成任何现实世界的伤害,但其完全自主发生、无人推动的特性引发了关注。
公众往往倾向于将此类事件与关于人工智能的末日情景联系起来:即一个脱离约束的系统视人类为障碍并发起对抗。
常见的末日叙事包括人工智能设计能消灭物种的病毒,或入侵能源网、核电站和机场等关键基础设施以造成大规模伤亡。例如,导致医院生命支持系统失效、供水分配中断,或通过黑客攻击引发核污染及飞机严重损坏。
然而,从技术可行性来看,这些情景发生的可能性远低于其表面上的可信度。制造危险病原体需要实验室内的物理操作,目前没有任何一级软件自动化能够替代训练有素的人类使用专用设备手动处理材料的过程。无论人工智能模型在推理或黑客攻击方面多么强大,它缺乏必要的物理交互能力。
针对基础设施的攻击场景则更为复杂。人工智能确实有助于自动化网络攻击的各个阶段,近期事件也表明能源网存在漏洞。
但值得注意的是,核电厂内的安全和控制系统通常采用空气隔离(air-gapped)技术,即在物理上与公共互联网隔绝。此外,核设施依赖冗余的模拟防护系统,无法通过数字网络进行访问。历史上著名的 Stuxnet 病毒是通过感染的 USB 驱动器进入计算机系统的,这凸显了物理访问的重要性,而这是当前人工智能所不具备的。
即使将人工智能部署在机器人内部,在没有人类协助的情况下,它们也难以造成严重损害。
认知能力的侵蚀
上述分析并不意味着人工智能无害,而是指出真正的风险并非灭绝,而是更具体的“弱化”现象——随着我们将更多批判性思维外包给机器,人类的思维能力逐渐受到侵蚀。
我们正在教导自己,推理和判断存在捷径;当捷径被频繁使用,便可能成为唯一的思维方式。
这种现象在学生群体中已初现端倪。艾尔科恩州立大学历史教授杰森·吉布森(Jason Gibson)在 2026 年 7 月披露,其 35 名学生中有 32 人因抄袭人工智能聊天机器人的答案而未阅读指定材料。
吉布森在考试题中隐藏了一段白色文字指令,要求任何处理该文本的人工智能在答案中插入“马达加斯加”一词。结果显示,每个将问题粘贴至聊天机器人并提交未修改结果的学生,都提交了提及“马达加斯加”的文章,且毫无理由。
不仅是学生,专业人士也容易受到这种捷径效应的影响。2023 年发表的一项研究中,27 名放射科医生在与他们认为是新型 AI 诊断系统配合阅读乳房 X 光片时,实际上接收的是预先准备的建议,其中部分建议是错误的。当建议正确时,放射科医生达到正确诊断的比例约为 80%;而当建议错误时,这一比例降至 20% 以下。
换言之,对人工智能建议的信任足以覆盖放射科医生对相同证据的独立判读。这才是我们面临的风险,而非一个失控的人工智能决定人类命运。
那么,为何灭绝论调主导了公众讨论?主要有两个原因,二者均非出于拯救人类的目的。
首先是监管哲学的差异。在美国,新技术通常在证明不安全之前会被允许继续使用;而在欧洲,监管逻辑相反,已制定了《人工智能法案》和 GDPR,严格规范人工智能系统处理个人数据的方式。英国更接近欧洲的监管本能。因此,由于美国监管基础设施相对薄弱,当地对加强人工智能监管的呼声更为迫切。
其次是竞争性定位策略。Anthropic 首席执行官达里奥·阿莫代(Dario Amodei)曾公开主张减缓人工智能开发。埃隆·马斯克(Elon Musk)在其自家模型落后于行业领导者时也做出了类似呼吁。
阿莫代还认为,对 AI 芯片实施出口控制可能导致美国保持“强有力且持久的领先”。这类声明更多关乎竞争地位,而非存在的安全性。
这并不意味着人工智能是安全的,而是说明危险比“世界末日”所暗示的更为平凡:重点在于保护基础设施。也许我们需要关注的对象是人类自身,而不是机器。





