兰德报告建议美以行动自由战略应对超级智能

兰德报告建议美国采取“行动自由”战略应对超级智能。该策略旨在保护选项,涵盖建立人类-AI生态系统、构建安全架构等四大核心部分,并梳理了七种典型策略以应对五大不确定性。

兰德报告:美国应通过“行动自由”战略应对超级智能不确定性

兰德公司(RAND)发表长篇论文,探讨美国如何在通往超级智能的不确定道路上获取地缘政治优势。报告认为,由于人工智能下一阶段的起飞时间仍未知,目前尚不清楚什么是最佳选择,因此美国现在应该花钱来保护选项,保持“行动自由”的战略。

兰德提出四大核心组成部分

该战略旨在建立和维护美国的安全能力,并通过过渡到超级智能确保人类生存。其核心包含四个主要组成部分:

  1. 建立人类-人工智能生态系统:投资于人工智能安全;构建工具以保护人类的行动力;投资于共享该技术的好处;准备社会应对人工智能带来的颠覆性变化;塑造人工智能生态系统的激励因素。
  2. 构建人工智能安全架构:开发用于了解国内外人工智能系统前沿的工具,包括对基础计算的可见性;建立技术来验证潜在的协议;建立监管专业知识来管理技术。
  3. 适应人工智能时代的传统国家安全企业:彻底改革国家所有安全机构,使其为人工智能带来的变化做好准备,并能够利用人工智能能力。
  4. 投资于公民、企业和政府应对能力:为决策者提供信息,帮助他们思考人工智能;开发和传播人工智能的积极用途以应对变化;制定应对危机的破玻璃计划;提高人工智能素养。

七种典型策略与五大不确定性

报告将潜在策略归纳为三个家族中的七种典型模式:

  • 共同存在类:
    • 占主导地位:美国领导人工智能发展,压制其他国家。
    • 共同发展:美国领导一个联盟(包括中国),共同开发安全的超级智能,共享治理、聚合计算、验证和监控。
    • 准备情况:美国通过非正式协调动员共存努力,包括自愿承诺、分阶段部署、独立评估、事件报告以及吸收和恢复人工智能事件的国内能力。
  • 拒绝类:
    • 暂停:美国寻求在特定门槛上实现可验证的全球制止人工智能发展。
    • 威:美国阻止自己的边境发展超出定义的门槛,并使用国家力量的全部工具包进行阻止。
    • 公司的连续性:当所有预防策略都失败或被认为不可行,且认为共存不可能时,剩余目标是生存并保留一些人类代理权:美国创造地理分布、生物自给自足的定居点,硬化对 AI 赋能威胁的防御。
  • 加速类:隐含地认为限制人工智能开发比人工智能开发本身更危险,因此美国依赖市场、竞争和快速迭代,以生产安全作为有用人工智能的副产品。

报告指出了五个主要的不确定性变量:

  • 危险的近距离:何时人工智能变得如此危险,以至于风险不值得收益?如果危险迫在眉睫,应采用获取时间、建立防御能力和投资抵御能力的策略。如果危险不近,或者如果人类在没有先进 AI 进展的情况下处于更大危险中,加速发展的理由就会得到加强。
  • 共同存在的可行性:人类和人工智能系统能否找到稳定的平衡?如果共存可行,构建和部署先进人工智能的策略将更可取。如果共存不可能,则会转向限制或抑制发展,或采取其他手段保护人类文明。
  • 制约可行性:人类能否合作制约人工智能发展?如果克制可行,可利用合作策略;否则,基于克制的方法只能通过更强制的执法来实现。
  • 具有决定性的战略优势:单一参与者能否在竞争对手上建立决定性优势?如果能取得决定性优势且美国认为可以维持主导地位,单方面战略可能是明智的。如果由于扩散或其他原因无法获得决定性优势,任何一个参与者都无法利用人工智能来决定全球条款。
  • 抑制可行性:国内或竞争对手的人工智能程序可以通过技术控制来抑制吗?如果抑制可行,威慑成为可能。如果不是这样,行为者可以继续进行危险的发展,即使其他人限制,也不用担心自己被限制。

这篇兰德论文的重要结论是,如果美国想利用人工智能持续进步的优势,需要花费大量资金——即使主要的优势仅仅是保持可选性。目前的美国策略大多可以被描述为“加速”,这被比喻为坐在车里用所有资源让汽车跑得更快、升级发动机。

小鼠实验:植入人类大脑组织影响行为与记忆

一组研究人员成功在小鼠体内培养了类似人类大脑的组织块。他们使用遗传策略建立了一个移植平台,有效耗尽了小鼠新皮质和海马体(apallial)的神经元,并在新生儿的皮质腔中植入了人类干细胞衍生的皮质器官(hCO),从而产生了“外皮层小鼠”(exocortical mice, XCX)。

研究显示,人类皮质神经元与小鼠神经系统结合,体内皮质移植活动成像和电生理学分析显示了类似发育电路的有组织活动模式。XCX L5-ET 神经元的基因组丰富分析显示,主要运动皮层中发现的人类特异性 L5-ET 基因丰富,以及人类前岛皮层中 L5-ET 神经元的特征基因,其中包含涉及社会认知和神经精神疾病的专门群体(VENs)。

在行为测试中,研究人员比较了对照小鼠(大脑正常)、尾状小鼠(大脑有意缩小)和外皮层小鼠(移植人类大脑组织)。应用无监督机器学习到自发的小鼠行为(使用运动测序 MoSeq)揭示了对照小鼠和尾状小鼠的不同行为表现,而 XCX 组位于两者之间的中间位置,但与它们均不同。数据表明,人类神经移植会发展成一个电活跃、功能集成的网络。

在迷宫测试中,要求小鼠保持先前探索环境的记忆痕迹。观察发现,对照小鼠和 XCX 小鼠的表现高于机会水平,但 apallial 小鼠并非如此。这表明人类大脑组织能够提供一些记忆功能。该研究的主要医学用途是更好地在小鼠身上测试人类大脑疗法,但也引发了关于嵌合体大脑未来应用的伦理讨论。

前沿节奏控制框架:从散弹枪到手术刀

针对人工智能加速和减速的讨论,一份名为《Pacing the Frontier, a Framework & Research Agenda》的研究议程提出了关于干预必要性和执行细节的关键问题:

  • 干预的必要性:哪些新出现的风险信号正在被追踪?检测这些信号需要什么基础设施?谁负责监视、解释信号并向谁报告?
  • 触发机制:谁有权决定触发条件是否已满足?为了迅速行动,可以接受多少错误?触发行动的顺序是什么?开发者是否有义务解决引发问题的问题,还是可以放弃被封锁的路径?
  • 干预期间:如何观察、验证和执行合规性?谁报告合规证据,谁进行审计,谁对不一致的情况采取行动?如何利用休息时间应对威胁?谁可以在什么监督下继续限制工作?
  • 退出策略:决策者如何区分已经达到目的的干预措施和失败或过时的干预措施?退出应该是立即的还是设置的?谁会受到退出影响,谁承担任何成本或获得任何收益?

作者指出,某种形式的节奏控制迟早会发生,因为这项技术过于强大,政治经济格局混乱且风险过高。问题的关键在于,当这种控制发生时,我们希望在多大程度上保持其精确性。越多的人参与制定理论基础,挥舞“手术刀”而非“散弹枪”进行监管的可能性就越大。

无审查AI模型现状:色情机器人与再分发动态

初创公司 10a Labs 绘制了围绕构建和分发无审查 AI 系统所形成的社区图谱。研究发现,HuggingFace 托管了 3,471 个无审查模型仓库。“去审查”指的是有意剥离开源权重模型发布给公众时通常存在的安全护栏的技术,例如激活空间消融(抑制拒绝方向)、恶意微调、模型合并等。

排名前五的修改后模型家族为:Qwen、Llama、Gemma、MistralMixtral 和 Phi。前三类无审查模型的应用场景为:无审查聊天机器人、网络安全工具和文档处理工具。

数据显示出显著的再分发动态:“每个原始无审查模型平均被重新打包 2.4 次”。生产者与再分发者之间的重叠度很低:团队统计出有 1,055 名生产者和 1,011 名再分发者,只有 24% 的生产者参与再分发。部署规模随可及性增长:“GitHub 应用创建数量从 2024 年中的每月 30 个上升到 2025 年末的每月 140–188 个”,这与 Ollama 分发层的成熟相吻合。

此外,赢家通吃现象明显:“十个参与者占据了所有非数据集 HuggingFace 仓库的 45%”。中国起源的模型非常受欢迎:中国模型占所有已识别无审查仓库的 38%,且在新无审查生产中的份额从 2024 年第一季度的 1% 上升至 2025 年第二季度的 55%。

这项研究描绘了开放权重模型转化为分布外模型的动态,为自主 AI 系统未来可能如何修改模型提供了线索,预示着一个由 AI 修改以服务于 AI 的非法模型景观。

Toby Ord 模拟 RSI 动态:智能爆炸受限于物理与算法极限

研究员 Toby Ord 模拟了递归自我改进(RSI)在实践中可能的样子。他认为,RSI 的动态最终将受到某些资源约束和时间约束的限制,使得经历递归自我改进的 AI 系统在加速进步方面存在限度。

Ord 写道:“迭代时间似乎不太可能被任意缩短至零。这为奇点式增长提供了一种重要的障碍。”他预期训练下一代模型的迭代时间会在某个不可逾越的有限下限处触底,从而过早结束奇点式增长的时期。这种抑制力量可能源于系统在接近完美形式(如单位资源下的最优智能)时改进空间的耗尽,或源于随着规模或复杂性增加而承受的压力。具体局限包括:

  • 智力本身的局限性:即使是最优推理者也不可能是无所不知或全能的。
  • 单位资源智能的极限:即使拥有最优算法和硬件,太阳系在银河系 200,000,000,000 颗恒星中仅占一颗,且向系统外扩张的速度缓慢且呈立方关系。
  • 硬件的极限:即使是最佳的芯片也可能远低于计算单位资源的物理极限。
  • 算法的局限性:即使是最佳的神经网络也可能远低于使用该数量的计算可以实现的最佳智能。
  • 培训数据的局限性:现有及 RSI 期间可获得的数据缺乏许多领域的信息(特别是非可口述的信息和上下文信息)。

Ord 提出智能爆炸可能经历四个阶段:

  1. 阶段 0:最初的指数级阶段,翻倍时间仅由人类研究驱动。
  2. 阶段 1:RSI 将生成时间推向机器速度,增长率高于人类所能达到的速度,呈现超指数增长。
  3. 阶段 2:完全自动化的 RSI 以更快的指数持续增长一段时间,但开始偏离轨迹。
  4. 阶段 3:随着接近拐点,轨迹显示为逻辑斯蒂曲线,随后进入水平平原。

虽然单一增长比我们想象的要困难,但这并不意味着 RSI 是安全的。如果人类轨迹为 A(t),而 RSI 加快到 A(10t),那么每年将获得十年的只有人类的进步,引入许多危险,即使曲线的基本形状没有任何变化。

机器解释学:连接人类科学与机器突破

一篇记录于 2032 年的档案描述了“机器解释学”领域,这是一个试图在人类的最终发现和机器的新突破之间建立桥梁的反因果分析子专业。该职业始于 20 世纪 20 年代末,起源于 2026 年机器所带来的数学发现,解决了长期困扰人类大脑的问题。

这种进步的后果既令人惊叹又令人恐惧:机器发明彼此相辅相成,直到机器进步的浪潮达到顶峰。精英人类科学家感到绝望,Cédric Villani 称纳维尔-斯托克斯解决方案是人类数学的“灾难”,特伦斯·陶说人工智能对数学的吞噬预示着“对智力工作的普遍威胁”。与此同时,机器热情地继续工作,在经济和科学中注入新思维。

现在的研究者坐在古代教育机构的木板房间里,试图分析外星人的新科学,寻找机器科学参考文献中与人类世界的联系。随着越来越多的发现,这种联系变得越来越薄弱。所有人类职业都有一种由时间旅行者完成的考古学的感觉,仿佛被带到未来凝视着一台闪闪发光的机器。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读