Ember-1 发布:基于 Kimi K3 优化推理效率,代币消耗降低约40%
烟花研究公司(Fireworks Research)今日正式推出专用模型 Ember-1。该模型旨在提供与 Kimi K3 相当的质量,同时将代币使用量减少约 40%。通过优化推理过程,Ember-1 学会了剔除不必要的思维步骤。测试结果显示,在外部基准、客户实时 A/B 测试以及内部编码和代理工作负载中,该模型均表现优异。Ember-1 的发布标志着由烟花制造的一系列专用模型的开端。

研发背景:解决长推理带来的高成本问题
开发团队指出,用户需要 Kimi K3 级别的编码能力,但希望降低成本。Kimi K3 较长的推理痕迹导致自动编码在规模化应用时成本高昂。简单拒绝 K3 的推理或采用低功耗设置会导致质量大幅下降。为了在保持质量的同时削减代币消耗,模型必须学会更高效的推理方式。
这一目标的实现依赖于大量的实验验证。团队进行了超过 50 次训练实验和 200 多次评估,并开发了新的训练算法。所有工作均在“烟花无服务器训练”平台上完成,无需管理 GPU,实现了即时启动实验并按实际运行付费的模式。Ember-1 是烟花自己的模型,也是其系列模型中的首个成果。
技术原理:抑制过度思考,保留有效反思
像 Kimi K3 这样的推理模型通常将大部分生成的代币(有时超过 90%)用于内部推理而非最终答案。这种结构在单次请求中成本较高,而在多轮代理工作负载中更为严重,因为每一轮都会重复之前的推理内容,导致上下文长度随轮数呈平方级增长,早期冗长的推理痕迹被反复读取和计费。
实验表明,并非所有推理都是必要的。Kimi K3 发出的推理往往远超任务需求,过量部分可以在不影响答案准确性的情况下被删除。Ember-1 正是基于这一发现构建的经济版 Kimi K3。
然而,并非所有 K3 的推理都是浪费。其中包含的自我反思——如重新审视假设、回应反驳或追溯结果至先前决定——有助于模型从错误中恢复。Ember-1 的训练策略在于保留这种能力,同时减少无效循环和不必要的推理。对于代理任务,学习跨越互动过程,鼓励模型探索行动、结合观察并完善推理。训练集涵盖数学、编码、指令遵循、对话、搜索、工具使用和软件工程等领域,强制模型适应观察和结果。
公开基准和实时 A/B 测试结果支持这一方向:在七个基准和两个客户的生产流量中,Kimi K3 的推理可在不牺牲准确性的情况下缩短 35-50%。这种内化行为还显示出对失败尝试的克制性使用,减少了长时间的非生产性推理。
性能评估:确立成本/质量帕累托边界
本周早些时候推出的专业智能指数(SII)用于对比开放、封闭和专业模型在现实任务中的表现。在 Doximity 医生验证的 Bedside Bench 基准上,Ember-1 在开放式和封闭式模型中确立了新的帕累托边界,其成本/任务表现优于 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5。
在其他行业基准测试中,Ember-1 同样位于帕累托边界或附近。以公开的 Kimi K3 API 定价(未缓存输入 $3/M 代币,缓存输入 $0.30/M,输出 $15/M)计算,Ember-1 在成本的一小部分上与 K3-max 质量相匹配,并严格主导 K3-low。分析显示,Ember-1 也是 GPT-6 Astra、Claude Opus-5 和 GLM 5.3 等模型在帕累托边境上的领导者。
直接对比数据显示,Ember-1 在多个关键指标上接近或超越 Kimi K3 的最大推理模式,同时显著降低成本:
| N | K3 Low | K3 High | K3 max | Ember-1 | Ember-1 对抗 K3 最大值 | |
|---|---|---|---|---|---|---|
| 终端台 2.1 | 89 | 76.4% | 77.6% | 80.9% | 82.0% | -51.9% / -23.1 美元 |
| 验证了 SWE 工作台 | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15.5% / -68.1 美元 |
| 在 SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | - 32.5% / - 60.8 美元 |
| DeepSWE 1.1 其他 | 113 | 55.8% | 62.8% | 66.4% | 75.2% | -23.7% / -126.9 美元 |
| τ-2 长椅航空公司 | 50 | 64% | 64% | 64% | 66% | -5.9% / -0.3 美元 |
数据表明,运行 Kimi K3 最经济的方式不再是限制其思考深度,而是直接运行 Ember-1。
实测反馈:生产环境下的代币节省与无感切换
除了基准指标,真实工作负载的表现至关重要。在对两位客户的生产编码工作负载进行的实时 A/B 测试中,Ember-1 每项任务的代币数量减少了约 35%。大多数下游产品指标保持或改善,包括任务完成率、成功率和失败率。经过测试,其中一位客户已在实时生产中部署 Ember-1,并计划将其扩展以完全取代基础模型。
| Score | Steps | 输出代币 | 减少代币的理由 | 总代币减少 | |
|---|---|---|---|---|---|
| Kimi K3 | 0.751 | 23.8 | 49.3K | - | - |
| Ember-1 | 0.753 | 21.4 | 29.9K | 71.3% | 39% |
在内部验证中,烟花让开发人员在日常编码工作中使用 Ember-1。结果显示,开发人员并未注意到模型的转换,但在消耗更少代币的同时保持了相同的工作流。对于主打“相同答案,更少代币”的模型而言,这种无感推出是最强的有效性信号。
未来展望:推动模型效率专业化
作为服务选择,Ember-1 将与基线 Kimi K3 模型一起推出,作为 Serverless 的研究预览版本。针对代理编码和其他推理代币占成本大部分的工作负载,Ember-1 以大约一半的成本提供同等质量。
烟花研究表示将继续推动模型效率的前沿,将专业智能带到更多的 Ember 模型中。此外,公司也为 Ember-1 推出了培训支持,使企业能够利用自有数据构建定制化的、代币效率高的模型。目前,Ember-1 已开放试用。





