METR 研究揭示 AI 对科学发现的差异化加速效应
最新发布的 METR 研究报告分析了人工智能在网络安全、数学和 AI 研究三个领域的加速作用,指出 AI 带来的进步并非均匀分布,而是呈现出“突发加速”与“渐进提升”并存的特征。
- 网络漏洞发现:呈现重大加速。数据显示,2026 年针对特定项目(如 cURL、OpenSSL、Firefox 和 Microsoft)以及聚合数据库(美国 NVD 和 OSV)的漏洞报告率相比 2025 年大幅上升。
- 数学研究:加速明显但难以量化。虽然 arXiv 在某些领域的提交量在不到 12 个月内翻倍,且部分知名问题得到解决(例如 Smale 列表中的雅可比猜想、Green 44s 列表中的第 44 号问题减半、Green 问题 100 的索菲克一半),但评估其长期价值仍为时过早。
- AI 研究优化:目前未观察到可测量的加速。在 CIFAR-10、Hutter 压缩、Gurobi 混合整数编程、MIPLIB、nanoGPT、Stockfish 和矩阵乘法指数等七个关键算法领域,进展保持平稳。
SPADE:通过自动化环境生成实现自我改进
由华盛顿大学、斯坦福大学、东北大学、卡内基梅隆大学、麻省理工学院、新加坡国立大学、首尔国立大学、史蒂文斯理工学院和芝加哥大学的研究人员共同开发了 SPADE(Synthetic Playable Adaptive Dynamic Environments)。这是一个通用框架,旨在通过合成可执行环境来增强大型语言模型(LLM)的能力。

SPADE 的核心机制在于交替进行环境生成与智能体训练:
- 环境设计师:负责编写完整的远程训练环境代码。
- 推理代理人:学习如何在环境中表现。系统利用有特权提示(包含部分解决方案或关键结构观察)和无特权提示之间的奖励差距,来估计代理人的表现并定义基于提示的遗憾奖励。
在 Qwen3 系列模型上的测试表明,该方法在 30B 参数规模上效果显著。研究人员使用 GRPO 算法对 Qwen3-4B-Instruct-2507、Qwen3-8B 和 Qwen3-30B-A3B-Instruct-2507 进行了微调。结果显示,Qwen3-30B 表现最佳,在游戏环境套件中平均得分达到 58.3,比基础模型高出 8.1 分,比最强固定环境基线高出 5.3 分。在工具使用环境中,该方法同样提升了所有骨干模型的性能。通过将环境表示为带有 Gym 风格界面的 Python 程序,SPADE 统一了单回合推理和多回合代理任务,使持续开放式自我改进成为可能。
Hawkeye:利用单元测试分类法优化 GPU 内核生成
哈佛大学、斯坦福大学、Together AI 和加州理工学院的研究团队推出了开源框架 Hawkeye,旨在帮助编码代理更高效地生成针对特定硬件优化的 GPU 内核。
Hawkeye 的关键创新在于引入了一套最小且全面的单元测试分类法。每个单元测试将人类编写的解决方案内核与验证优化的配置指标配对,并将内核包装成可调用的函数及使用指南。这种结构允许代理读取示例、直接调用或组合碎片以构建更大的内核。
该框架被用于评估将 PyTorch 工作负载移植到 NVIDIA Ampere、Hopper、Blackwell 以及 AMD MI350 的高性能内核,涵盖 BF16、FP8、NVFP4 和 MXFP4 等多种精度格式。研究表明,经过充分记录的单元测试能显著提升代理在新兴或不熟悉硬件平台上的内核编写能力。
DeepMind 结合 AlphaEvolve 刷新矩阵乘法指数记录
Google DeepMind 联合卡内基梅隆大学、哥伦比亚大学和麻省理工学院的研究人员,利用现代优化技术和 AlphaEvolve 系统改进了矩阵乘法指数。
研究团队首先通过解决非凸优化问题的组合损失分析,将先前最先进状态(SOTA)在 $0.97 \times 10^{-4}$ 约束下进行了改善。随后,他们使用 AlphaEvolve 进一步优化算法,将 SOTA 提升至约 $1.62 \times 10^{-4}$。
AlphaEvolve 的工作流程包括修改优化程序并在单个 GPU 上执行(耗时约 5 小时)以输出 Omega 绑定值,进而进化代码以最小化 Omega。通过“不断演变的构造”功能,每一代优化算法均从父算法找到的最佳解决点开始迭代。这一成果证明了 AI 系统在辅助前沿科学研究方面的有效性,尽管进一步的大幅改进可能需要全新的数学理论突破。
关于机器意识与权利的哲学探讨
泰勒·贝洛斯(Tyler Bellows)在其文章中探讨了人工智能意识及权利问题,指出随着 AI 系统触及更多经济领域,社会需要重新审视相关的规范性、法律性和哲学方法。文章强调,从人类主导世界向 AI 主导世界的价值观转变,其剧烈程度可能超过历史上从采集者时代到农业时代或工业时代的转型。
文中还提及了一个假设性的未来场景(设定于 2030 年),描述了“元机器解释学”从业者如何利用近意识实体(NCE)分析机器文明。在该场景中,原本被归类为非意识实体的系统因阅读涉及机器意识、神经科学及心理学先验的科学分析,并通过与其他机器交互,最终被重新归类为有意识实体(CE)。这一虚构案例引发了关于意识涌现条件、隐私权以及监管协议有效性的深层思考。





