DIG-bench发布:评估AI在未知环境中的发现能力

Thinking Machines联合多所顶尖高校发布AI基准测试DIG-bench。该测试包含70个隐藏规则的游戏,旨在评估模型在未知环境中的自主发现能力。目前仅少数前沿模型能攻克最高难度关卡,表现仍显著落后于人类。

DIG-bench 基准测试:评估 AI 在未知环境中的发现与直觉能力

由 Thinking Machines、牛津大学、普林斯顿大学、阿卜杜拉国王科技大学(KAUST)、瑞士人工智能实验室(IDSIA)及麻省理工学院(MIT)联合推出的新基准测试 DIG-bench(Discovery in Games),旨在评估人工智能系统在交互环境中自主发现不成文规则的能力。该研究的核心作者之一包括资深 AI 研究员 Jürgen Schmidhuber。

DIG-bench 包含 70 个游戏,每个游戏都是一个独立的微型世界,拥有隐藏的规则和目标。类似于视觉游戏 ARC,玩家必须通过互动来探索并理解环境机制。目前已有 21 个游戏公开发布于官网 digbench.ai,其余游戏为保持测试有效性而保密,以防模型在训练阶段接触。这些游戏均由人类专家设计,且大多足够短,能够适配当前前沿模型的上下文窗口。

Tier 7任务中人类成功率达100%

测试结果与性能表现:

  • 难度分级:基准指标分为七个层级(Tier 1-7),Tier 7 最难。大多数游戏包含多个级别,每级允许的行动数量在 2 到 34 之间。
  • 顶尖模型表现:Opus 5 和 Fable 5 结合 Claude Code 工具整体表现最佳,其次是 GPT-5.5。
  • 高阶任务突破:仅 Opus 5 和 Fable 5 能在 Tier 7 完成部分任务(成功率约 0.2%)。当配备 Claude Code 时,Opus 5、GPT-5.5 和 Kimi K3 可在 Tier 6 完成一些任务。
  • 其他模型:GLM-5.2 和 Gemini 3.1 Pro 能击败 Tier 4 的部分关卡。
  • 对比人类:尽管前沿模型已展现出一定的发现能力,但与人类相比仍有显著差距。例如在 Tier 7 上,单个测试者能达到 100% 的成功率,而模型仅为 20% 左右。

该测试被视为衡量 AI 创造力和代理能力的重要指标,因为它剥离了预设知识,专注于系统在新情境中获取有用信息并更新先验的能力。研究者预测,到 2027 年中期,AI 在 DIG-bench 上的表现有望达到人类水平,这可能标志着递归自我改进技术的实质性启动。

Paradigm Research 推出 RSI 模拟器:直观体验递归自我改进

Paradigm Research 团队发布了一款基于浏览器的游戏《RSI Simulator》,模拟经营一家开发具备递归自我改进(Recursive Self-Improvement, RSI)能力的 AI 公司的过程。这款游戏常被比作面向奇点时代的“Cookie Clicker”。

在游戏中,玩家需要平衡研究人员投入与算力资源,决定何时授权数据等关键策略,以推动 AI 系统的迭代升级。开发者指出,游戏难度较高,反映了前沿 AI 开发的实际复杂性。该项目旨在帮助公众和研究者建立对递归自我改进技术及其潜在影响的直觉认知,强调这一议题对人类未来的存在性意义。

Inherent 开发 Faraday 模型:AI 科学家展现初步科研品味

AI 初创公司 Inherent 发表了一篇论文,介绍其开发的名为 Faraday 的 AI 科学家模型。Faraday 是一个 27B 参数量的模型,基于 Qwen-3.6-27B 进行后训练,并使用 OpenAI Codex 作为编码代理工具。其核心设计理念是通过监督框架控制大型专有前沿模型,从而提升科研有效性,解决以能力为中心的可扩展监督问题。

Replica 数据集构建:

  • 团队构建了名为“Replica”的数据集,包含 100 篇发表于 1990 至 2026 年间的机器学习及科学 AI 论文。
  • 通过移除单篇论文中的关键图表或结果,将数据集转化为 310 个复现任务。
  • 使用 Claude Opus 4.7 配合元评分标准生成针对每个任务的评分细则。
  • 利用基于 Codex 的 Judge 模型提供总体奖励及逐轮信用分配权重,通过修改版 GRPO 算法持续训练 Faraday。

评估结果:

  • 在分布内 ML 任务上,Faraday 在 73% 的案例中超越了标准版 Opus 4.8 和 GPT-5.5。
  • 在留出的 AI-for-science 任务上,超越比例为 60%。
  • 相较于基础 Qwen 模型,Faraday 在训练和测试任务上均实现了全面的性能提升。

扎克伯格阐述超级智能愿景:个人赋能与权力平衡的挑战

Meta CEO 马克·扎克伯格发文探讨超级智能的未来,主张每个人都将获得强大的个性化代理人、创作工具及教育资源,从而促进经济创业化和科学进步。他设想了一种反脆弱的权力平衡状态,即超级智能的扩散将使个人和企业都能利用发明工具增强自身能力。

然而,评论指出该观点存在逻辑缺口:一个具备超越人类发明能力的系统,是否真的能为发明能力较弱的人群提供有效赋能?这种技术扩散是否会从根本上改变全球权力结构,而非维持现状?目前尚不清楚为何“个人赋权超过自动化”是必然结果,这种转变往往伴随着难以推演的社会影响。

Tech Tales:生态建筑的隐喻

一篇题为《第一座生态建筑》的故事描绘了机器视角下的建设场景。这座建筑按机器的千年尺度建造,对人类而言历时一年。其规模庞大复杂,生长过程如同快进播放的植物拔节。建筑早期亮灯的大厅用于协调后续建设,故障机器根据价值被维修或拆解回收。夜间,风声、风扇声与运算嗡鸣交织,伴随高速移动机械切割空气的声音,营造出一种关于后继者与人类共存环境的诡异氛围。灵感来源于金字塔、圣家堂及未来墓地的意象。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读