Reflection发布501B参数MoE模型Beam,主打编码与代理

Reflection推出501B参数MoE模型Beam,主打编码与代理任务。该模型推理仅激活23亿参数,基于23.8万亿token预训练及大规模强化学习,性能逼近前沿开源模型,计划本月晚些时候开放权重。

Reflection 推出首个开放权重模型 Beam:501B MoE 架构,主打编码与代理任务

Reflection 近日宣布推出其首款开放权重大语言模型——Beam。这是一款稀疏专家混合(MoE)架构的模型,拥有 5010 亿总参数,但在推理过程中仅激活 23 亿个参数。该模型主要面向编码、逻辑推理及代理工作负载场景。

激活23亿参数实现高效推理

Beam 的性能提升得益于在预训练和强化学习(RL)阶段的大规模投入。据官方介绍,模型在 23.8 万亿个经过精心策划的高质量多样化 token 上完成了预训练。此外,团队开发了专门的算法、训练环境和基础设施,以支持超大规模的高计算量 RL 训练。在为期四周的训练周期中,Beam 使用了 10,500 块 NVIDIA GB300 GPU,累计产生了超过 1 亿次部署(rollouts)。

目前,Beam 正在进行最后的红队测试和评估。官方计划在本月晚些时候公布模型权重、技术报告、模型卡片以及开发者工具包。用户可通过注册获取模型的早期访问权限。

基准测试表现:逼近前沿开源模型

在能力方面,Beam 专注于优化编码和代理性能。测试数据显示,Beam 在西方开源权重模型中处于领先地位,其在编码和代理任务上的表现可与更大的开源模型如 GLM 5.2 竞争,并接近 Qwen 3.8-Max 的水平。尽管 Kimi K3 等模型在原始能力指标上仍保持领先,但 Beam 展现了极高的性价比。

下表展示了 Beam 在各类编码、代理、推理和 STEM 基准测试中的得分(NR 表示未报告):

基准测试BeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144.4NRNR44.061.068.051.074.2
SWE Bench Pro v2-Hard77.256.9NRNR84.388.2NRNR
SWE Bench Pro v165.554.346.462.1NRNR67.7NR
Terminal Bench v2.180.163.856.481.088.288.386.690.6
SWE Atlas Codebase QnA34.6NRNRNR61.068.0NRNR
Multilingual SWE-Bench78.0NR67.7NRNRNRNRNR
SWE-Bench Verified80.977.670.7NRNRNRNRNR
AIME 202697.897.1NR99.2NRNRNRNR
No Tools (Reasoning)36.229.726.740.542.346.943.639.1
SciCode49.746.144.6NR59.058.752.152.0
US Crypto16.35.43.120.919.123.420.014.3
GPQA Diamond90.587.28791.291.793.592.690.9
Automated Public Platform37.0NRNR26.248.246.739.854.8
Max Graphs78.776.063.177.884.282.384.5NR
Banking38.025.022.637.1NR37.155.2NR
BrowseComp (with Context Mgmt)77.477.144.4NRNR91.2NRNR
Deep Search QA (with Context Mgmt)80.1NRNRNRNR95.0NRNR
AA-LCR79.377.379.378.379.788.780.384.0
Long Board v265.5NR61.964.0NRNR66.3NR
IFBench79.779.881.773.3NRNR82.8NR
Only Public Split (Internal)13.014.28.6NR22.6NRNR6.6

推理效率与成本控制

Beam 的核心优势之一在于其高效的推理能力。在高级推理基准测试中,Beam 在使用比 GLM-5.2 少 344 倍的推理计算量时,达到了相当的得分水平。与参数量超过 2T 的模型家族(如 Qwen 3.8-Max)相比,Beam 的单位 token 推理计算需求显著降低,从而实现了更高的每 token 智能密度。

这种效率使得 Beam 能够以更低的成本提供强大的模型功能,成为企业级编码和代理工作负载的理想选择。根据估算,对于混合专家模型,其生成前向传播的计算量约为 $FLOP \approx 2 \times \text{Active Parameters} \times \text{Avg Tokens Generated}$。Beam 在 DeepSWE、Humanity's Last Exam (HLE) 和 Terminal Bench 2.1 等测试中均展现了边界级的推断效率。

高计算量强化学习技术细节

Reflection 将高计算量强化学习确立为 Beam 的主要扩展轴。通过扩大 RL 规模,模型得以更广泛地探索解决问题的策略。长周期的 rollout 支持了多步推理、工具使用以及对环境反馈的适应。

为了支撑这一规模的训练,团队在四周内调度了 10,500 块 NVIDIA GB300 GPU,并构建了包含约 13 亿个沙箱环境的训练体系。此外,还采购了 100 万个高质量的编码、代理和 STEM 环境。这被认为是迄今为止公开实验室进行的最大规模 RL 运行之一。随着 RL 计算量的增加,模型在评估套件中的能力持续提升,未见饱和迹象。

异步策略梯度与稳定性

Beam 采用非同步策略梯度进行训练。在大规模训练中,策略老化(Policy Staleness)是主要的稳定性挑战,因为长期 rollout 生成的 token 可能来自多个旧的模型检查点。同时,训练引擎与推理引擎之间的数值不匹配也加剧了这一问题。

为此,开发团队设计了新算法以保持稳定学习,并系统性地减少管道中的训练-推理不匹配。这些改进使得完全异步的 RL 即使在从一天前的交互中学习时也能保持稳定。演示数据显示,即使面对落后当前策略 107 个权重版本的陈旧度,数值依然保持稳定。

推理长度与能力的权衡

在 RL 训练早期,模型学会了用更少的推理步骤解决任务,表现为完成长度下降但性能提升。后期随着代理能力的增强,完成长度再次增长,但这些额外的 token 带来了进一步的性能提升。用户可以通过调整 Beam 的“推理力度”参数来控制这一权衡:较低设置倾向于短响应,较高设置则允许更长推理以提升复杂任务表现。

泛化能力与应用演示

Beam 的 RL 训练旨在培养跨领域的推理和行为能力。尽管训练组合中未包含浏览任务,但模型在获得网络访问权限后,有机地学会了搜索文档、查询其他 LLM 以及使用 OCR API 读取文件。

官方展示了以下应用案例:

  • 宇航员自由落体游戏:要求 Beam 在 p5.js 中创建一个 3D 游戏,角色需躲避或摧毁小行星。虽然 Beam 是多模态无关的纯文本模型,但它能基于文本推理出游戏的视觉呈现逻辑。
  • Land or Water 泛化实验:重现了一个 viral X 谜题,要求创建覆盖全球经纬度的网格。由于该谜题出现时间晚于训练数据截止日期,此测试验证了模型的泛化能力。Beam 达到了 95.5% 的正确率,介于 Opus 5 (92.5%) 和 Fable 5 (97.8%) 之间。
  • 纽约地铁实时地图:利用公开的 NYC MTA 数据构建实时更新的地铁地图。模型自主搜索文档、检查认证要求、获取地理数据,并实现了前端后端搭建及服务器持续运行。
  • 模型微调笔记本:在一个分布外领域(Text2SQL),Beam 被要求研究 Unsloth 文档并为最新的 Gemma-4 模型创建微调笔记本。最终成功实现微调,使 Gemma 在保留测试集上的准确率提高了 66.5%。

基础设施与环境构建

前沿规模的 RL 需要大量高难度、高质量的任务环境。Reflection 通过合成数据管道、专有供应商数据和开源来源,构建了近百万个环境池。任务筛选过程严格,确保任务既非始终可解也非不可能完成,且具备高质量定义。

在基础设施方面,团队构建了一个异步平台,支持平均 110K 并发 rollout。关键特性包括:

  • 完全异步执行:Agent 生成 rollout 的同时,Trainer 进行学习并发布新版本。每个 token 标记版本信息,以便处理策略陈旧性。
  • 灵活算力分配:推理与训练 GPU 比例动态调整(3.9:1 至 5.4:1),并在同一训练谱系中无缝切换 GPU 网格配置。
  • 快速模型更新:新权重通过 RoCE 跨机架传输,再经 NVLink 本地共享,中位延迟约 12 秒。相比直接拉取,跨机架流量减少 75%,全集群采用速度提升 2.2 倍。
  • 故障恢复能力:运行期间处理了 71 次推理事故,未终止训练作业。推理容量恢复中位时间为 8 分钟,损失容量仅占服务 GPU 分钟的 0.02%。
  • 大规模环境支持:支持最高 170K 并发沙箱,处理超过 10 亿次沙箱创建请求。90% 的新沙箱在 10 秒内就绪。
  • 高效 Trainer 打包:动态打包使训练批次平均填充率达 99.99%,即使平均 rollout 长度增长近 70%,单 GPU 吞吐量波动仍控制在 1.5% 以内。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读