Reflection 推出首个开放权重模型 Beam:501B MoE 架构,主打编码与代理任务
Reflection 近日宣布推出其首款开放权重大语言模型——Beam。这是一款稀疏专家混合(MoE)架构的模型,拥有 5010 亿总参数,但在推理过程中仅激活 23 亿个参数。该模型主要面向编码、逻辑推理及代理工作负载场景。

Beam 的性能提升得益于在预训练和强化学习(RL)阶段的大规模投入。据官方介绍,模型在 23.8 万亿个经过精心策划的高质量多样化 token 上完成了预训练。此外,团队开发了专门的算法、训练环境和基础设施,以支持超大规模的高计算量 RL 训练。在为期四周的训练周期中,Beam 使用了 10,500 块 NVIDIA GB300 GPU,累计产生了超过 1 亿次部署(rollouts)。
目前,Beam 正在进行最后的红队测试和评估。官方计划在本月晚些时候公布模型权重、技术报告、模型卡片以及开发者工具包。用户可通过注册获取模型的早期访问权限。
基准测试表现:逼近前沿开源模型
在能力方面,Beam 专注于优化编码和代理性能。测试数据显示,Beam 在西方开源权重模型中处于领先地位,其在编码和代理任务上的表现可与更大的开源模型如 GLM 5.2 竞争,并接近 Qwen 3.8-Max 的水平。尽管 Kimi K3 等模型在原始能力指标上仍保持领先,但 Beam 展现了极高的性价比。
下表展示了 Beam 在各类编码、代理、推理和 STEM 基准测试中的得分(NR 表示未报告):
| 基准测试 | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | NR | NR | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Bench Pro v2-Hard | 77.2 | 56.9 | NR | NR | 84.3 | 88.2 | NR | NR |
| SWE Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | NR | NR | 67.7 | NR |
| Terminal Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | NR | NR | NR | 61.0 | 68.0 | NR | NR |
| Multilingual SWE-Bench | 78.0 | NR | 67.7 | NR | NR | NR | NR | NR |
| SWE-Bench Verified | 80.9 | 77.6 | 70.7 | NR | NR | NR | NR | NR |
| AIME 2026 | 97.8 | 97.1 | NR | 99.2 | NR | NR | NR | NR |
| No Tools (Reasoning) | 36.2 | 29.7 | 26.7 | 40.5 | 42.3 | 46.9 | 43.6 | 39.1 |
| SciCode | 49.7 | 46.1 | 44.6 | NR | 59.0 | 58.7 | 52.1 | 52.0 |
| US Crypto | 16.3 | 5.4 | 3.1 | 20.9 | 19.1 | 23.4 | 20.0 | 14.3 |
| GPQA Diamond | 90.5 | 87.2 | 87 | 91.2 | 91.7 | 93.5 | 92.6 | 90.9 |
| Automated Public Platform | 37.0 | NR | NR | 26.2 | 48.2 | 46.7 | 39.8 | 54.8 |
| Max Graphs | 78.7 | 76.0 | 63.1 | 77.8 | 84.2 | 82.3 | 84.5 | NR |
| Banking | 38.0 | 25.0 | 22.6 | 37.1 | NR | 37.1 | 55.2 | NR |
| BrowseComp (with Context Mgmt) | 77.4 | 77.1 | 44.4 | NR | NR | 91.2 | NR | NR |
| Deep Search QA (with Context Mgmt) | 80.1 | NR | NR | NR | NR | 95.0 | NR | NR |
| AA-LCR | 79.3 | 77.3 | 79.3 | 78.3 | 79.7 | 88.7 | 80.3 | 84.0 |
| Long Board v2 | 65.5 | NR | 61.9 | 64.0 | NR | NR | 66.3 | NR |
| IFBench | 79.7 | 79.8 | 81.7 | 73.3 | NR | NR | 82.8 | NR |
| Only Public Split (Internal) | 13.0 | 14.2 | 8.6 | NR | 22.6 | NR | NR | 6.6 |
推理效率与成本控制
Beam 的核心优势之一在于其高效的推理能力。在高级推理基准测试中,Beam 在使用比 GLM-5.2 少 344 倍的推理计算量时,达到了相当的得分水平。与参数量超过 2T 的模型家族(如 Qwen 3.8-Max)相比,Beam 的单位 token 推理计算需求显著降低,从而实现了更高的每 token 智能密度。
这种效率使得 Beam 能够以更低的成本提供强大的模型功能,成为企业级编码和代理工作负载的理想选择。根据估算,对于混合专家模型,其生成前向传播的计算量约为 $FLOP \approx 2 \times \text{Active Parameters} \times \text{Avg Tokens Generated}$。Beam 在 DeepSWE、Humanity's Last Exam (HLE) 和 Terminal Bench 2.1 等测试中均展现了边界级的推断效率。
高计算量强化学习技术细节
Reflection 将高计算量强化学习确立为 Beam 的主要扩展轴。通过扩大 RL 规模,模型得以更广泛地探索解决问题的策略。长周期的 rollout 支持了多步推理、工具使用以及对环境反馈的适应。
为了支撑这一规模的训练,团队在四周内调度了 10,500 块 NVIDIA GB300 GPU,并构建了包含约 13 亿个沙箱环境的训练体系。此外,还采购了 100 万个高质量的编码、代理和 STEM 环境。这被认为是迄今为止公开实验室进行的最大规模 RL 运行之一。随着 RL 计算量的增加,模型在评估套件中的能力持续提升,未见饱和迹象。
异步策略梯度与稳定性
Beam 采用非同步策略梯度进行训练。在大规模训练中,策略老化(Policy Staleness)是主要的稳定性挑战,因为长期 rollout 生成的 token 可能来自多个旧的模型检查点。同时,训练引擎与推理引擎之间的数值不匹配也加剧了这一问题。
为此,开发团队设计了新算法以保持稳定学习,并系统性地减少管道中的训练-推理不匹配。这些改进使得完全异步的 RL 即使在从一天前的交互中学习时也能保持稳定。演示数据显示,即使面对落后当前策略 107 个权重版本的陈旧度,数值依然保持稳定。
推理长度与能力的权衡
在 RL 训练早期,模型学会了用更少的推理步骤解决任务,表现为完成长度下降但性能提升。后期随着代理能力的增强,完成长度再次增长,但这些额外的 token 带来了进一步的性能提升。用户可以通过调整 Beam 的“推理力度”参数来控制这一权衡:较低设置倾向于短响应,较高设置则允许更长推理以提升复杂任务表现。
泛化能力与应用演示
Beam 的 RL 训练旨在培养跨领域的推理和行为能力。尽管训练组合中未包含浏览任务,但模型在获得网络访问权限后,有机地学会了搜索文档、查询其他 LLM 以及使用 OCR API 读取文件。
官方展示了以下应用案例:
- 宇航员自由落体游戏:要求 Beam 在 p5.js 中创建一个 3D 游戏,角色需躲避或摧毁小行星。虽然 Beam 是多模态无关的纯文本模型,但它能基于文本推理出游戏的视觉呈现逻辑。
- Land or Water 泛化实验:重现了一个 viral X 谜题,要求创建覆盖全球经纬度的网格。由于该谜题出现时间晚于训练数据截止日期,此测试验证了模型的泛化能力。Beam 达到了 95.5% 的正确率,介于 Opus 5 (92.5%) 和 Fable 5 (97.8%) 之间。
- 纽约地铁实时地图:利用公开的 NYC MTA 数据构建实时更新的地铁地图。模型自主搜索文档、检查认证要求、获取地理数据,并实现了前端后端搭建及服务器持续运行。
- 模型微调笔记本:在一个分布外领域(Text2SQL),Beam 被要求研究 Unsloth 文档并为最新的 Gemma-4 模型创建微调笔记本。最终成功实现微调,使 Gemma 在保留测试集上的准确率提高了 66.5%。
基础设施与环境构建
前沿规模的 RL 需要大量高难度、高质量的任务环境。Reflection 通过合成数据管道、专有供应商数据和开源来源,构建了近百万个环境池。任务筛选过程严格,确保任务既非始终可解也非不可能完成,且具备高质量定义。
在基础设施方面,团队构建了一个异步平台,支持平均 110K 并发 rollout。关键特性包括:
- 完全异步执行:Agent 生成 rollout 的同时,Trainer 进行学习并发布新版本。每个 token 标记版本信息,以便处理策略陈旧性。
- 灵活算力分配:推理与训练 GPU 比例动态调整(3.9:1 至 5.4:1),并在同一训练谱系中无缝切换 GPU 网格配置。
- 快速模型更新:新权重通过 RoCE 跨机架传输,再经 NVLink 本地共享,中位延迟约 12 秒。相比直接拉取,跨机架流量减少 75%,全集群采用速度提升 2.2 倍。
- 故障恢复能力:运行期间处理了 71 次推理事故,未终止训练作业。推理容量恢复中位时间为 8 分钟,损失容量仅占服务 GPU 分钟的 0.02%。
- 大规模环境支持:支持最高 170K 并发沙箱,处理超过 10 亿次沙箱创建请求。90% 的新沙箱在 10 秒内就绪。
- 高效 Trainer 打包:动态打包使训练批次平均填充率达 99.99%,即使平均 rollout 长度增长近 70%,单 GPU 吞吐量波动仍控制在 1.5% 以内。





