Falcon-Emirati-7B发布:专注阿联酋阿拉伯语方言


阿拉伯语并非单一语言,而是一个庞大的语言家族。现代标准阿拉伯语(MSA)常见于新闻和教科书,但并非日常交流的主要形式。在阿联酋,日常对话、幽默、谈判及讲故事均使用阿联酋阿拉伯语方言。阿联酋诗歌,特别是纳巴提诗歌,富含谚语和简短故事。仅掌握 MSA 的模型虽能翻译字面意思,却难以捕捉文化细微差别。

方言忠实度得分0.52远超竞品

Falcon-Emirati-7B 旨在填补这一空白。作为基于 Falcon-H1-Arabic 构建的方言专用模型,它专注于理解和生成阿联酋阿拉伯语。

技术架构:基于 Falcon-H1-Arabic

Falcon-Emirati-7B 建立在 Falcon-H1-Arabic 基础之上。该系列采用 Falcon-H1 混合架构,在每个区块内并行运行状态空间模型(Mamba)和 Transformer 注意力机制,并在投影前合并输出。这种设计使 Mamba 在处理长序列时具备线性时间效率。Falcon-H1-Arabic 家族涵盖 3B、7B 和 34B 三种参数规模,上下文窗口最高可达 128K 至 256K tokens,并已利用广泛的 MSA、多种阿拉伯语方言(海湾、黎凡特、埃及、马格里布)以及英语和多语言数据进行训练。

选择 7B 变体进行方言适配是出于平衡考量:7B 模型足够大以保留方言适应所需的细微差别,同时保持训练和推理的实用性。尽管 34B 模型可能进一步提升质量,但对于方言专用聊天模型而言,其训练和服务成本过高。

方言适配的挑战

将通用阿拉伯语模型转化为阿联酋方言专家比从头建立基础模型更具挑战性,主要难点包括:

  • 数据稀缺性:阿拉伯语方言主要是口语形式,网上书面内容远少于 MSA,甚至少于其他海湾或黎凡特方言。
  • 非字面意义:谚语、习语和诗歌引用依赖共同的文化背景,而非表面词汇。
  • 缺乏标准化规则:目前尚无完善文档指导如何将方言数据与 MSA 及普通阿拉伯语混合,也未明确哪个训练阶段(持续预训练、SFT 或偏好优化)对方言选择最为关键。

因此,Falcon-Emirati-7B 的开发过程大量依赖试错,测试不同的数据组合、训练阶段和监督策略。

数据策略

团队在 Falcon-H1-Arabic 预训练基础上建立了专门的阿联酋数据管道:

1. 真实的阿联酋方言网络数据

从阿联酋网站和论坛抓取原本用方言撰写的内容,确立模型学习阿联酋人在线写作和说话方式的基础真相。

2. 关于阿联酋文化与身份的 MSA 数据

收集涉及阿联酋文化、遗产和语言的 MSA 文章与参考文献。此类数据不教导模型使用方言写作,但增强其谈论阿联酋话题时的知识深度。

3. 受词典和风格规则指导的合成数据

为覆盖聊天模型需处理的各类话题,团队生成了大量合成的阿联酋方言数据。通过严格的规则、词典和字典限制生成器模型,确保合成输出符合阿联酋词汇和语法规范,避免产生“语法正确但不自然”的结果。

评估方法

训练进展通过两种互补方法进行跟踪:

母语使用者手动评价

除判断答案正确性外,重点评估自然性、语气和文化适度性。这些指标无法通过基准评分完全体现,但母语者能立即识别。

Alyah 自动评估基准

采用 Alyah(意为“北极星”)基准测试,这是由团队及社区共同发布的专门评估阿拉伯语 LLM 处理阿联酋方言能力的工具。Alyah 包含 1,173 个样本,数据由阿联酋母语者手动采集,涵盖日常问候、修辞表达、传统文化知识及阿联酋诗歌等类别。

测试结果分析

在 Alyah 排行榜上,Falcon-Emirati-7B 超越了其他对比的阿拉伯语和多语言指令微调模型。

结果显示,模型规模并非决定方言能力的唯一因素。部分大型多语言模型得分低于较小但更熟悉方言的模型。最佳表现通常来自以阿拉伯语为中心或以其为母语的模型,证实了通用阿拉伯语和方言覆盖的重要性。

即使强大模型在进入真正的方言和文化嵌入内容时也会出现性能退化,这表明需要专门为方言构建的数据和评估体系。

开放式生成评估

多项选择题准确率无法反映模型自主生成阿联酋阿拉伯语的能力。因此,团队对同样的 1,173 道 Alyah 题目进行了开放式文本生成评估,并由 LLM 评审(Gemini 3.7 Flash)对五个模型打分:Falcon-Emirati-7B、ALLaM-7B-Instruct-preview、gemma-3-27b-it、Jais-2-8B-Chat 和 Fanar-2-27B-Instruct。

在方言忠实度方面,Falcon-Emirati-7B 得分为 0.52(部分信用),显著高于 ALLaM (0.05)、gemma-3-27b-it (0.03)、Jais-2-8B-Chat (0.02) 和 Fanar-2-27B-Instruct (0.00)。这意味着其他模型往往知道正确答案,但倾向于默认为 MSA,而 Falcon-Emirati-7B 是唯一可靠地使用被询问方言回答的模型。

此外,Fanar-2-27B-Instruct 在 26.2% 的情况下拒绝回答,远高于其他模型不到 5% 的比例,其正确性分数为五项中最低(0.27)。

分类别数据显示,Falcon-Emirati-7B 的优势并非局限于特定问题类型,而是普遍切换至阿联酋方言。竞争对手在问候和日常表达(阿联酋语与 MSA 重叠最多的类别)表现相对较好,但在其他领域差距明显。

成对比较胜率

通过 Gemini 3.7 Flash 进行的盲测对决显示,Falcon-Emirati-7B 在大多数类别中战胜 Jais-2-8B-Chat、ALLaM-7B-Instruct-preview 和 Fanar-2-27B-Instruct。

在诗歌和创意表达、语言和方言类别中,Falcon-Emirati-7B 优势最大。例如,在与 Fanar-2-27B-Instruct 的对决中,其在诗歌类别胜率为 0.88 对 0.12,在宗教和社会敏感性类别为 0.80 对 0.20。仅在问候和日常表达类别中,Falcon-Emirati-7B 小幅输给 Jais-2-8B-Chat (0.46 对 0.54),但仍大幅领先 Fanar-2-27B-Instruct (0.70 对 0.30)。

文化理解能力

在阿拉伯文化对话的阿联酋部分评估中,模型需在三个选项中选择最适合文化的答案。测试涵盖 283 个阿联酋场景。

Falcon-Emirati-7B 获得 85.57% 的最高分,领先于 ALLaM-7B (83.39%)、Jais-2-8B (73.79%) 和 Fanar-2-27B (71.50%),凸显其在识别阿联酋对话中文化适宜反应方面的能力。

可用性与局限性

Falcon-Emirati-7B 已在聊天平台上线,访问地址为:https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B

如同任何语言模型,Falcon-Emirati-7B 可能反映训练数据中的偏见。鉴于方言和文化细微差别的主观性,建议用户在敏感、官方或高风险操作前先评估模型适用性,并欢迎阿联酋社区提供反馈。

致谢

感谢 Mikhail Lubinets 和 Matthieu Berjon 在计算基础设施方面的支持,以及 Jatin Mittal 协助通过 Falcon Chat 应用实现模型访问。

引用信息

@misc{falcon_emirati_7b_2026,
  title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
  author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid}, 
  organization = {Technology Innovation Institute},
  year = {2026}
}

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读