阿布扎比技术创新研究所(TII)近日发布了 Falcon-ASR,这是一款拥有 16 亿参数的语音识别模型。该模型重点优化了阿联酋方言的识别能力,同时支持英语、法语、西班牙语和葡萄牙语。

在 TII 进行的内部评估中,Falcon-ASR 在六个阿拉伯语测试集上的平均词错误率(WER)为 20.92%。针对阿联酋方言的专项测试显示,其 WER 为 22.73%,字符错误率(CER)为 10.19%,均为对比系统中的最低值。此外,该模型还支持词级时间戳功能,能够将转录文本中的每个单词与音频中的具体位置对应起来。
用户可通过 Hugging Face 演示空间试用 Falcon-ASR。
应对阿拉伯语方言多样性挑战
阿拉伯语在不同地区、口音及录音环境下存在显著差异。传统的语音识别模型在处理正式新闻广播时表现尚可,但在面对阿联酋方言对话或电话录音等日常场景时往往力不从心。由于方言阿拉伯语的转录资源远少于现代标准阿拉伯语(MSA),模型的训练和评估难度较大。
Falcon-ASR 的训练数据涵盖了阿联酋方言、MSA、其他海湾及阿拉伯方言以及英语。其设计目标是准确转录人们日常使用的语言,包括各种方言形式及语码转换现象。
阿拉伯语基准测试结果
根据由 ELM 研究中心维护的 Open Universal Arabic ASR 排行榜协议,Falcon-ASR 在六个测试集的加权平均指标上表现优异。较低的 WER 和 CER 数值代表更好的性能。
| Model | 参数 | 平均 WER (%) | 平均 CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 20.92 | 8.79 |
| Audar-ASR-V1-Turbo | 2.35B | 23.17 | 9.23 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 25.87 | 11.80 |
| omniASR LLM 7B | 7.0B | 28.32 | 12.52 |
注:WER = 词错误率;CER = 字符错误率。数值越低表示性能越好。
此次评估基于排行榜固定表格进行。竞争对手的数据取自 2026 年 9 月 30 日检查的公开排行榜平均值。Falcon-ASR 的平均 WER 比该快照中公布的最佳结果高出 2.25 个百分点的优势区间(原文表述为优于最佳结果,此处保留原意逻辑,即数值更低更优,原文“优于”指代性能更好,数值上表现为差值优势)。
阿联酋方言专项评估
虽然公共评估数据如 Casablanca 数据集已包含阿联酋子集,但 TII 通过引入额外的阿联酋及海湾地区演讲记录进行了补充评估。这些内部测试使用了专门的测试记录和经过人工审核的参考文本。
在内部阿联酋评估中,Falcon-ASR 取得了以下成绩:
| Model | 参数 | WER (%) | CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 22.73 | 10.19 |
| Qwen3-Omni-30B-A3B-Instruct | 30.0B (3.0B active) | 26.80 | 12.72 |
| Audar-ASR-V1-Turbo | 2.35B | 27.89 | 13.75 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 31.05 | 18.07 |
| Qwen3-ASR-1.7B-hf | 2.0B | 31.52 | 13.35 |
| Audar-ASR-V1-Flash | 0.78B | 32.87 | 15.36 |
数据显示,Falcon-ASR 在所有对比系统中实现了最低的 WER 和 CER。其 WER 比次优系统 Qwen3-Omni 低 4.07 个百分点,表明其在词汇和字符层面的转录精度均有显著提升。
适应复杂录音环境
为了增强模型的鲁棒性,训练过程中引入了背景噪音、重叠语音、音乐、房间回声以及电话效果等多种干扰因素,并模拟了语速和音调的变化。这种处理方式同样应用于阿联酋方言数据的训练中,旨在让模型能够应对会议、电话及其他日常录音场景中可能遇到的各种声学条件。
多语言支持能力
Falcon-ASR 使用相同的模型权重处理英语转录任务。在 Hugging Face 开放 ASR 排行榜采用的七个公开英语测试集上,其平均 WER 为 5.74%。
| 测试套件 | WER (%) |
|---|---|
| LibriSpeech clean | 1.75 |
| LibriSpeech other | 4.21 |
| SPGISpeech | 2.02 |
| VoxPopuli | 3.87 |
| GigaSpeech | 8.15 |
| AMI | 8.33 |
| Earnings-22 | 11.86 |
除阿拉伯语和英语外,该模型还支持法语、西班牙语和葡萄牙语。所有五种语言共享同一套权重,无需预先指定语言标识,输出结果为口语内容的直接转录文本。
技术基础
Falcon-ASR 建立在 Falcon3-Audio 的工作基础之上。关于 Falcon3-Audio 的架构设计及训练方法,可参阅论文《具有数据效率的公共数据单阶段培训的竞争性音频语言模型》。





