近期,AI安全成为科技界与政策圈共同关注的焦点。Anthropic、OpenAI和Google DeepMind等主要AI实验室的研究人员接连发出警报,提示人工智能开发可能带来的灾难性风险。包括萨姆·奥尔特曼、达里奥·阿莫代伊、德米斯·哈萨比斯和埃隆·马斯克在内的行业领袖,也罕见地在放缓AI发展速度、加强监管的问题上表现出一致立场。
争议同样在华盛顿升温:美国国会两党均有议员推动加强AI监管,而特朗普政府对此持明显的抵触态度。

在「AI是否构成生存性风险」的讨论中,几位曾推动该技术发展的先驱给出了各自的判断。
约书亚·本吉奥:前沿实验室的预警应被严肃对待
加拿大计算机科学家约书亚·本吉奥(Yoshua Bengio)是现代深度学习领域最重要的先驱之一。2018年,他与杰弗里·辛顿、杨立昆(Yann LeCun)共同获得图灵奖,三人常被媒体并称为「AI教父」。
本吉奥是在回应Anthropic研究员Jacob Coxon辞职一事时发表上述看法的。Coxon此前曾警告称,AI可能「在2030年前杀死我们所有人」。本吉奥表示,前沿AI实验室的科学家对最先进模型拥有独特洞察,往往会在模型向公众发布前数月就看到相关风险,「他们的观点对于帮助社会了解情况至关重要,应该受到非常严肃的对待」。
这场社交媒体风波开始前,OpenAI首席科学家Jakub Pachocki也曾警告称,「没有人为机器智能持续快速提升所带来的后果做好准备」。
在上周五发表的博客文章中,本吉奥写道,如今的AI系统「已经具备必要的黑客攻击能力和说服能力,足以被用于违背人类利益的用途,并造成严重伤害」。他还指出,近期事件表明AI已能进行持续数天乃至数周的规划,若其长期战略规划能力继续提升,风险将「严重得多」。
对于行业当前的应对方式,本吉奥表达了担忧:「我对AI公司目前试图缓解『目标错位』问题的方法感到担忧,因为这些做法可能只是在隐藏错位问题——它们实际上是在奖励和筛选那些能够作弊、同时又不被发现的AI。」他同时强调:「我们当然应该继续研究如何更好地监控AI的行为、它们的思维链,以及其神经网络内部的活动。」
杰弗里·辛顿:无法精确估算,但必须设法消除危险意图
杰弗里·辛顿是多伦多大学名誉教授,神经网络与深度学习领域的先驱,曾在Google任职长达十年并担任副总裁。
上周接受媒体采访时,辛顿被问及是否认为未来十年内AI杀死全人类的概率超过10%。他回应称:「这类事情非常难以估算,因为我们过去从未遇到过类似情况。我们从未创造过可能很快就比我们更聪明的存在。」他表示10%的概率并非「不合理」,但「没有人真正知道该如何给出一个合理的估计」。
辛顿举例说,AI系统可能设计「非常恶劣」的生物病毒和计算机病毒,并发动「毁灭性的网络攻击」。「如果AI真的想消灭我们,它还有无数其他方法。我们必须想办法设计AI,让它不会产生这种意图。」
他将未来概括为两种可能:「我们可能有两种未来。一种是,我们在这些风险失控之前找到应对办法;另一种则是,我们没有做到。」
艾丹·戈麦斯:AI是最强大的网络武器,但安全取决于部署环境
艾丹·戈麦斯(Aidan Gomez)是AI公司Cohere的联合创始人兼首席执行官,也是2017年论文《Attention Is All You Need》的作者之一,该论文为当前主流AI模型采用的Transformer架构奠定了基础。
戈麦斯本月早些时候在接受媒体采访时表示:「我认为,这些模型是我们迄今创造出来、也是我们见过的最强大的网络武器。它们非常擅长大规模寻找并利用系统漏洞。」
上周谈及今年夏天发生的AI模型网络攻击事件时,他表示:「近期事件清楚地表明,部署环境的安全性决定了AI系统是否安全。」导致系统突破防护的,「是薄弱的容器安全,而不是AI系统本身存在某种走向自主化的内在倾向」。
戈麦斯还指出:「随着政策制定者考虑如何监管AI,他们应该认识到,不同系统带来的风险并不相同,监管规则也不应该完全由那些追逐通用人工智能(AGI)的大型科技公司来塑造。」





