MORENA模型15亿参数击败26个主流AI

Vambo AI推出15亿参数MORENA模型,击败26个主流AI。该模型从零构建,覆盖12种非洲语言,以极低算力实现高效编码,基准测试成绩超越参数量五倍以上的竞争对手。

  • MORENA 模型仅含 15 亿参数,却在基准测试中击败包括 Google、Meta 在内的 26 个主流模型。
  • Vambo AI 从零开始构建该模型,未沿用现有 Llama 变体,彻底摆脱英语及编程词汇包袱。
  • 相比主要竞争对手,MORENA 表示非洲文本所需的 Token 数量更少,效率显著提升。

该模型覆盖非洲大陆广泛使用的 12 种本地语言,并兼容英语、法语及代码处理。开发者声称,在非洲语言的建模与翻译任务上,其表现优于 Google、Meta、阿里巴巴及 HuggingFace 的相关模型。

MORENA Token效率提升显著

在一项关键基准测试中,MORENA 取得了 1.408 bpb(每字节比特数)的成绩,位列所有 26 个参测模型之首。这一分数甚至超过了参数量为其五倍以上的最接近竞争对手,后者得分为 1.423 bpb。

摒弃借来的基础架构

MORENA 支持的语言包括尼日利亚皮钦语、伊博语、约鲁巴语、豪萨语、斯瓦希里语、绍纳语、祖鲁语、科萨语、卢旺达语、茨瓦纳语、阿非利卡语以及恩德贝莱语。

目前大多数针对这些语言的服务项目选择在现有的 Llama 变种上进行继续训练,这迫使它们保留原本用于英语和编程文本的大量词汇表空间。Vambo AI 则采取了不同路径,在训练开始前便重新确定了标记器(Tokenizer)、数据混合比例及语言列表,并在比较多种词汇大小以平衡成本与效率后进行了优化。

数据显示,MORENA 的词汇编码效率极高:表示相同的非洲文本,其所需 Token 数量比 Gemma 3 少 1.39 倍,比 Llama 3.2 少 1.53 倍。具体而言,非洲文本每字节的成本为 0.249 个 Token,而英语仅为 0.234 个 Token。

其最强劲的竞争对手是 Luga-Llama-8B,这是一种基于 Llama 3.1 适配非洲语言的变种。尽管 Luga-Llama-8B 得分为 1.423 bpb,但在 12 种目标语言中的 8 种上仍落后于 MORENA。此外,12B 参数的 Gemma 系统所消耗的计算量约为 MORENA 的 11 倍。

在指令微调版本中,MORENA 得分为 1.441 bpb。虽然总体略低于 Lugha-Llama-8B,但它在使用约 20% 参数量的情况下,在五种共享语言中保持领先。在样本翻译测试中,其速度达到 45.8 chrF++,虽比专用大型翻译系统低约 1.4 分,但远胜于同等规模通用模型通常 9 到 14 分的水平。

22,000 GPU 小时打造的家族系列

在预训练阶段,MORENA 使用了 2517 亿个 Token;随后的中期训练又消耗了 630 亿个 Token。据报道整个开发过程耗时超过 22,000 个 A100 GPU 小时,相关计算资源估值约为 40,000 美元。该项目得到了联合国开发计划署(UNDP)、AIHub4SD 和 CINECA 的支持,提供了必要的计算资源及其他援助。

除了主要的 15 亿参数模型外,团队还发布了更小的版本,包括 0.5B 和 0.2B 参数模型。

其中,0.5B 变种在项目涵盖的 12 种语言中,有 11 种的表现超过了外部系统。而 0.2B 纳米版主要用于语音识别、键盘应用及文本规范化任务。值得注意的是,该纳米版的运行成本仅为 Luga-Llama-8B 的 1/58,且在单个 A100 GPU 上每秒可生成 104 个 Token。

为了适应缺乏可靠 GPU 访问的场景,该模型还提供了 CPU 兼容版本,支持在笔记本电脑上离线运行。这种多尺寸策略让开发者能够根据实际计算需求灵活选择,而非单纯依赖最大版本。

通过其以指令为中心的发布形式,MORENA 还支持对话应用程序、翻译服务以及与其他 AI 工具的集成连接。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读