Kolibri主权大模型发布:78B参数支持1M上下文

Kolibri主权大模型开源,78B参数支持1M上下文。该MoE架构单次激活仅3B参数,专为受监管领域设计,在双语环境下实现质量与成本帕累托最优,并采用Apache 2.0许可证发布。

Kolibri:面向受监管领域的主权开放大模型发布

在德国统一日,开发团队正式推出新一代混合专家(MoE)Transformer 模型——Kolibri。该模型总参数规模为 78B,单次推理激活参数约 3B,支持最高 1M token 的上下文长度。目前,Kolibri 已在 Hugging Face 平台上线,并采用 Apache 2.0 许可证开源。

78B总参数量仅激活3B

Kolibri 专为公共管理、工业制造及航空航天等受监管领域的关键任务设计。通过针对德语能力、逻辑推理、数学运算及代理行为(Agentic Behavior)的深度优化,该模型旨在帮助客户在特定垂直场景中实现可衡量的投资回报率。其核心设计理念包含两个维度:一是技术层面的专业化性能,二是架构层面的主权合规性。团队强调对供应链完整性的控制,确保客户拥有完全的部署自由与知识产权安全,使合规成为模型的固有属性。

核心能力与性能表现

在英语和德语双语环境下,Kolibri 在质量与服务成本之间达到了帕累托最优边界。这意味着在同等算力成本下,没有竞品能提供更高的输出质量;而在同等质量要求下,也没有竞品能以更低的成本提供服务。这种效率优势使得企业能够在本地环境中高效运行模型,无需将内部敏感数据发送至第三方云端服务。

与其他后训练模型在英语(左)和德语(右)环境下的吞吐量对比。图表展示了未加权平均基准分数与每秒解码文本量/GPU的关系,位置越靠右上表示性能越好。

尽管激活参数仅为 3B,Kolibri 在数学、编码、长文本处理及接地(Grounding)任务上的表现,足以匹敌那些激活参数量为其四倍的模型(如 Nemotron 3 Super)。在涵盖数学、代码、长上下文、智能体能力及知识储备的统一量表(0–100分)测试中,Kolibri 展现出均衡且具竞争力的通用能力。

Kolibri 基础能力雷达图。分数越高代表在该领域的基准测试表现越强。

针对公共部门、航空、制造业和汽车工业等特定行业,团队开发了独立的内部评估套件,以弥补公开基准无法捕捉行业细微需求的缺陷。数据显示,经过持续的后训练,Kolibri 在这五个垂直领域的表现呈上升趋势。

基于内部客户代理基准的连续后训练运行中的上下文化绩效。点代表单次检查点评估,线代表每日评估平均值。

在事实依据方面,Kolibri 引入了“默林-阿瑟协议”(Merlin-Arthur Protocol),通过弃权数据进行训练。当上下文信息不足以支撑答案时,模型被明确训练为回答“我不知道”,从而抑制幻觉生成。这一特性对于需要高可靠性的企业级应用至关重要。

此外,Kolibri 并非简单的“懂德语的英语模型”。团队设计了专门的双语标记器,并在预训练中严格限制机器翻译数据的使用比例(仅占 6%),以确保德语能力的原生性和文化准确性。

技术架构与训练流程

模型工厂与迭代速度

Kolibri 的开发依托于高度自动化的“模型工厂”流水线。从 Kolibri Origin 到最终版 Kolibri,间隔仅三个月。在此期间,模型参数从 30B 增至 78B,上下文窗口从 65k 扩展至 1M,训练数据量从 7.5T token 提升至 20T。为了获取这 20T 高质量训练数据,流水线处理了超过 200T 的原始 token,经过过滤、去重和精选形成最终数据集。

指标 Kolibri Origin Kolibri
完成预训练日期 2026 年 6 月 11 日 2026 年 9 月 11 日
公开发布日期 无 2026 年 10 月 3 日
推理模式 单一模式 多模式(无、低、中、高)
总参数 30.6B 78.1B
活动参数/Token 3.27B 3.46B
预训练 Token 数 7.51T 20T
层结构 50 层 (2 密集 + 48 MoE) 50 层 (全 MoE,含共享专家)
预训练上下文长度 8,192 16,384
最长训练长度 65,536 262,144
词汇表大小 96,000 128,000
注意力头 (Q/KV) 32 / 4 48 / 4
专家数量 (总数/活跃) 128 / 8 384 / 6
专家隐藏维度 768 512
注意力机制 全层标准注意力 滑动窗口 (512) + 每第5层全注意力
知识截止日期 德国:2025 年 8 月 1 日 2026 年 6 月 18 日

整个训练过程实现了高度自动化。在 Kolibri 为期 21 天的预训练中,共发生 38 次非计划中断(约每 10,000 GPU 小时一次),均由系统自动检测并从最近检查点恢复,无需人工干预。训练检查点每小时生成一次,并自动进行多维度评估,使团队能够实时监控模型能力的演进。

架构设计与预训练细节

Kolibri 采用 78B 总参数规模,是在性能与成本之间的权衡结果。实验表明,虽然更大规模的模型(如 123B)能带来轻微的性能提升,但其推理成本显著增加。相比之下,78B 模型在两张 H100 GPU 上可同时处理 18 个并发请求,而 123B 模型仅能处理 3 个长上下文请求,且解码速度慢 28%。

在架构上,Kolibri 使用了 384 个较小的专家模块而非少数大型专家,以提升路由效率。注意力机制方面,50 层网络中仅有 10 层处理完整上下文,其余 40 层使用 512-token 的聚焦窗口,以此限制计算量和内存占用。

训练在 768 块 B200 GPU 上进行,分为三个阶段:

  • 预训练: 20T tokens,序列长度 16k,耗时 21 天。
  • 中期训练: 3.44T tokens,序列长度 64k,侧重推理、问题解决及代理数据。
  • 长上下文适应: 200B tokens,序列长度 256k,通过将长文档与高质量中期数据交错训练,避免早期技能退化。

德语数据在预训练混合中占比超过 20%(约 4.3T tokens),英语约占 62%,代码约占 14%。优化器选用 Muon,并引入了精确分位数平衡(Exact Quantile Balancing)算法来改进专家路由负载平衡,该算法源自 Kimi K3 的研究,但在本项目中实现了固定成本的精确计算。

后训练与对齐

后训练分为监督微调(SFT)和大规模强化学习(RL)两步。SFT 阶段生成了 174B tokens 的合成数据,结合开源数据筛选后形成 268B tokens 的高质量训练集。RL 阶段则覆盖了超过 120 万个精心策划的任务,涉及代码、数学、工具调用等领域。

模型被训练出四种推理强度层级(无、低、中、高),允许用户根据具体场景在成本、延迟和答案质量之间进行灵活权衡。这一特性使得 Kolibri 能够适应从快速问答到复杂逻辑推演的多样化需求。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读