AlphaGo第37手启示:AI需具备真正推理能力

AlphaGo第37手棋击败李世石,其创造力源于搜索机制而非直觉。当前大语言模型仅靠预测生成内容,缺乏独立推理状态与知识分离,难以在科学医学领域产生可靠新见解。

2016年3月,在首尔的一场围棋比赛中,AlphaGo在第5行落下一子。这一手棋——第37手——在当时看来荒谬至极,却最终帮助AlphaGo以4比1击败历史最伟大的职业围棋选手之一李世石。事后,DeepMind AlphaGo团队核心成员、伦敦大学机器学习教授托尔·格雷佩尔(Thore Graepel)回忆称,尽管他最初认为AlphaGo仅基于概率计算,但目睹这一着法后,他意识到机器具备了某种形式的创造力。

AlphaGo依赖搜索而非直觉

然而,将第37手棋简单归结为“机器直觉”是一种误解。实际上,这一创造性选择源于AlphaGo的推理能力,而这正是当前人工智能系统所普遍缺乏的关键特质。若希望AI在未来科学和医学领域产生可靠结果及真正的新见解,必须赋予其这种真正的推理机制。

AlphaGo的双重架构:直觉与搜索

AlphaGo由两个主要系统组成。首先是策略网络,经过训练以预测高水平人类棋手的落子习惯。从该网络的“直觉”来看,第37手棋并无特别之处,专家级人类下出此招的概率仅为万分之一。促使AlphaGo做出这一选择的,是其搜索机制。该机制超越了眼前的合理性,通过显式构建并搜索拥有数千分支的博弈树,权衡候选着法的未来后果。

这类似于丹尼尔·卡内曼(Daniel Kahneman)提出的行为科学理论中的“系统2”思维:缓慢、逐步且深思熟虑。AlphaGo的网络提供预感,判断某个举动是否有希望或位置是否占优;而其搜索机制则进行审议,通过后续着法和反应来测试这些预感。正如人类认知一样,任何一半都无法单独工作:仅凭直觉无法选出第37手,而缺乏搜索能力则难以遍历所有可能的动作。

大型语言模型的局限:仅有“系统1”

这与当今主流的人工智能模型运作方式截然不同。大型语言模型(LLM)通过一遍又一遍地预测下一个符号来生成内容。这相当于“系统1”在行动中:快速、关联性强,并能出色地完成几乎任何主题的模式匹配。

在ChatGPT亮相后不久,业界意识到需要制造能够“深思熟虑”的模型。目前的解决方案是引入“思维链”(Chain-of-Thought),即让模型不立即给出答案,而是生成中间步骤来分解问题、推进部分结果并影响后续推理。这在数学和编码任务中取得了进展。但与AlphaGo的搜索不同,思维链并未引入真正独立的推理机制:中间的推理步骤仍然由相同的下一个代币预测过程生成,只是模型在承诺最终答案前花费了更长时间。

科学家指出,聊天机器人的这种处理方式存在三个主要缺陷,使其难以被视为真正的推理:

  • 缺乏明确的认识状态: 模型通常没有开放、持久且可检查的账本,列出其正在考虑的假设、对不同解释的信心水平、正在权衡的证据以及未解决的问题。这些状态应随新信息的到来而系统性修改。
  • 知识与推理界限模糊: 系统所知道的内容与其如何操纵这些知识之间缺乏清晰分离。知识和推理在神经网络的权重中不可分割地交织在一起,没有独立表示的信念集。
  • 事后编造: 虽然聊天机器人产生的思维链看起来像是深思熟虑的过程,但研究表明,机器人往往是在事实发生后编造出这些推理路径。

迈向可靠的机器推理:借鉴AlphaGo架构

在医疗诊断、工程设计和科学研究等高风险应用中,当错误发生时,我们需要确定问题的根源:系统的推理是否有过错?是否基于无效证据?还是做出了错误的假设?这正是托尔·格雷佩尔近期离开谷歌职位的原因。他认为,我们需要一种新的机器推理方法,其基础应回归到AlphaGo的架构逻辑。

AlphaGo记录了其对某一局面的理解:游戏树。这个数据结构包含了AlphaGo考虑的所有变化、可能的未来,每一个动作和位置都被神经网络做出的判断所标注。随着推理的深入,AlphaGo更新游戏树,并最终合成其中的信息来决定行动。

同理,对于一般性推理,一个系统应该保持一种“认识状态”,代表系统认为已解决的内容、存疑的内容、排除的内容以及仍开放的问题。推理可以被理解为一系列改变认识状态的动作,旨在推进知识并减少不确定性:推断后果、将问题分解为部分、决定要问什么问题、执行什么计算或进行什么实验。

当然,开放式推理比围棋或国际象棋等封闭规则游戏更为困难。在现实世界中,当前情况仅在某种程度上已知,可用行动的集合庞大且可变,行动的后果往往是随机或未知的。但最近LLM和其他神经模型的进步,让我们有能力处理这样的一般推理问题。例如,LLM可以根据已知情况和可用资源提出解决问题的方法,通过API或代码与工具交互,并帮助评估主张是否有可用证据支持。

关键在于保持系统的诚实性。系统的独立部分必须根据每一动作实际解决不确定性的程度进行评估,只在变化得到证据支持时更新信念。一旦这些规则得到执行,模型可以通过学习过去的推理经验来积累经过认证的知识并改进其推理政策。这种系统可以被视为一种“用类固醇进行的科学方法”,目的是产生能够经受审查的知识。

托尔·格雷佩尔强调,不能通过单纯扩大“系统1”来实现可靠的机器智能,因为规模并不能使直觉变得更加深思熟虑。第37手棋之所以重要,是因为机器掌握了局面,权衡了可能的未来,并选择了其人工本能可能会拒绝的动作。社会需要在药物发现、材料科学、气候研究和诊断等领域进行创新举措。我们只能从理性系统中获得这样的洞察力——这些系统的结论来自可审核的证据、推断和信念修订,而不是事实后讲述的令人信服的故事。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读