OpenAI称后Astra模型可解顶尖数学难题

OpenAI高管称内部模型GPT-5.5、GPT-5.6分别达普通和顶尖数学教授水平,后Astra模型据称可解决顶尖数学家难题;总裁称在另一千禧年大奖难题取得进展,引发学界对AI能力与学术生态的讨论。

OpenAI CEO萨姆·奥特曼(Sam Altman)在近日与Salesforce CEO Marc Benioff的一场对谈中,披露了公司内部模型的最新研发进度。他先给出了一个基准判断:"GPT-5.5的水平大概相当于一个普通的数学教授。GPT-5.6,大概能比肩全球排名前1%到2%的顶尖数学教授。"

随后他透露了一个更关键的信息:"在这个代号为Astra的模型之后,我们还有一个内部模型(Post-Astra)。它已经能够解决世界上最顶尖数学家都束手无策的难题。"

166页证明通过形式化验证

几乎同一时间,OpenAI总裁Greg Brockman在公开场合也表示:"我们还在另一个『千禧年大奖难题』上取得了重大进展。"

值得注意的是,理论计算机科学界权威、德州大学奥斯汀分校教授Scott Aaronson近期发布了一篇长文,标题为《奇迹与恐怖的时代》。这位以谨慎著称、曾对AI威胁论持强烈怀疑态度的学者,在文中写下这样的判断:"AI奇点已经开始了。人类数学家,已经被永远拉下了神坛。"

01

后Astra模型:OpenAI内部模型的能力坐标

按照奥特曼给出的标尺,OpenAI内部模型的数学能力可以划分为三个层级:

GPT-5.5,对应普通数学教授水平。 即具备日常推导公式、阅读前沿论文、为本科生乃至研究生批改高阶数学作业的能力。

GPT-5.6,对应全球前1%至2%的顶尖教授。 即具备在一流学术期刊发表原创性数学发现的能力,这一水平足以在常春藤院校获得终身教职。

Post-Astra(后Astra)模型,则被认为超越了全球最强数学家。 奥特曼称其能解决人类顶尖数学家束手无策的难题。

对于这一说法,外界反应不一。有网友表示震惊,也有人持保留态度,认为可能存在夸大,并指出相关AI成果可能只是"吸收"了人类数学家已有的思路,而非独立创造。不过,无论评价如何,OpenAI正在以大规模算力推进模型数学能力的提升,这一点是明确的。

千禧年大奖难题:一项已被突破,另一项据称取得重大进展

上周,"纳维尔-斯托克斯方程"被突破的消息已在数学界引发震动。据悉,OpenAI为此投入至少1500万美元(约合1亿元人民币)的算力,由AI推导出了长达166页的证明过程,并通过了Lean形式化系统的严格验证。

而就在人类数学家尚未完全消化这166页证明之际,Greg Brockman又宣布OpenAI在另一个千禧年大奖难题上取得重大进展。目前未解的千禧年大奖难题仅剩五个:

  • P与NP问题
  • 黎曼猜想
  • 杨-米尔斯规范场与质量间隙
  • 霍奇猜想
  • BSD猜想

其中关注度最高、也最令人警惕的是P与NP问题。若P=NP被证明,其影响将远超数学领域:意味着现有加密体系(包括银行密码、核武器发射密码等)可能被瞬间破解,物流、医疗资源分配、新药研发等问题都能被迅速求得最优解。

另有传闻称,OpenAI可能已接近解决霍奇猜想或BSD猜想。目前尚无官方细节披露。

02

Scott Aaronson的转变:从怀疑论到承认"奇点已至"

Scott Aaronson是量子计算理论领域的权威学者,提出了"玻素采样"(Boson Sampling)这一量子霸权实验的核心概念,同时也是学术界知名的谨慎派代表。

二十年前,面对AI将统治世界的警告,Aaronson当时的回应是:除非AI能解开千禧年数学难题,否则不必认真对待这种担忧。

如今,他的立场发生了根本转变。

在《奇迹与恐怖的时代》一文中,Aaronson用一长串"A"表达了强烈的情绪冲击,并写道:

"在我看来,奇点已经到来了……在剩下的岁月里,我大概再也不会去证明任何一个定理了。因为世界不再『需要』我去证明。如果我还在做数学,那仅仅是为了我自己或他人的娱乐,就像人类下国际象棋一样。"

他还公开表示,AI安全领域的先驱Eliezer Yudkowsky——其观点过去常遭学界嘲讽——关于文明面临重大挑战的预言可能是正确的,而包括他自己在内的许多人都判断失误。

文中一段描述也引发广泛共鸣:他在晚上哄孩子睡觉时感到不安,思考孩子们未来将面对怎样的世界、今天所学的知识还能否派上用场。他13岁的女儿半开玩笑地说,如果她想成为数学家,大概只剩下两周的时间了。

对于人类如何接纳AI这种远超自身的存在,Aaronson使用了一个宗教化的比喻:当机器解决了纳维-斯托克斯方程和数十个长期悬而未决的数学难题、且能力仍在以月为单位飞速提升时,接受它的现实,就像接受一个具有超凡力量的存在降临人间一样,已成为"认识论上的最低底线"。

03

学术界的连锁反应:审稿体系承压,人才流向AI安全领域

Aaronson在文中列出了近期一批借助AI完成或由AI独立攻克的长期悬而未决的问题,包括:

  • 雅可比猜想的反例,由Anthropic研究员在世界杯决赛期间借助名为Fable的AI模型发现;
  • 黎曼几何中格罗滕迪克常数的边界得到显著改进;
  • 费马大定理在Lean中完成全面形式化验证;
  • 量子计算领域Watrous解缠合猜想获证,实现QMA的完美完备性证明。

他形容当前学术期刊的处境如同《魔戒》中的守城战:编辑和会议主席正在"城墙上加固防御",迎接海量AI参与产出的论文。人类审稿人实际上已被迫借助AI进行审稿,否则防线将很快被淹没。

学术共同体由此面临一系列现实问题:论文如何署名、当证明过程超出人类理解能力时数学研究的意义何在,以及数学作为人类知识与审美传承的"人类性"是否会丧失。

以陶哲轩为首的25位菲尔兹奖得主已联名发表公开信,其中并未要求停用AI,而是提出核心关切:人类是否会因此失去数学的"人类性"。他们认为,数学不只是判定猜想真伪,更是一个代代相传的人类社区,人们通过理解、顿悟与交流感受宇宙法则的简约之美。如果未来的数学成果以数百页人类难以消化的形式化论证呈现,人类的角色退化为校对与翻译,愿意投入十年寒窗进入这一领域的天才少年恐怕会越来越少。

与此同时,硅谷与顶尖高校之间正在出现人才流向的转变。包括普林斯顿高等研究院的Mike Winer在内,一批物理学家和数学家放弃了原有的学术路径,转向AI安全与对齐研究。在他们看来,确保这个能力仍在快速增长的系统与人类利益保持一致,已成为比在黑板上推导公式更为紧迫的任务。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读