TII发布Falcon-ASR:16亿参数优化阿联酋方言识别

阿布扎比TII发布16亿参数语音模型Falcon-ASR。该模型重点优化阿联酋方言识别,在内部测试中词错误率低至20.92%,支持多语言及词级时间戳功能,用户可在Hugging Face试用。

阿布扎比技术创新研究所(TII)近日发布了 Falcon-ASR,这是一款拥有 16 亿参数的语音识别模型。该模型重点优化了阿联酋方言的识别能力,同时支持英语、法语、西班牙语和葡萄牙语。

WER低至20.92%

在 TII 进行的内部评估中,Falcon-ASR 在六个阿拉伯语测试集上的平均词错误率(WER)为 20.92%。针对阿联酋方言的专项测试显示,其 WER 为 22.73%,字符错误率(CER)为 10.19%,均为对比系统中的最低值。此外,该模型还支持词级时间戳功能,能够将转录文本中的每个单词与音频中的具体位置对应起来。

用户可通过 Hugging Face 演示空间试用 Falcon-ASR。

应对阿拉伯语方言多样性挑战

阿拉伯语在不同地区、口音及录音环境下存在显著差异。传统的语音识别模型在处理正式新闻广播时表现尚可,但在面对阿联酋方言对话或电话录音等日常场景时往往力不从心。由于方言阿拉伯语的转录资源远少于现代标准阿拉伯语(MSA),模型的训练和评估难度较大。

Falcon-ASR 的训练数据涵盖了阿联酋方言、MSA、其他海湾及阿拉伯方言以及英语。其设计目标是准确转录人们日常使用的语言,包括各种方言形式及语码转换现象。

阿拉伯语基准测试结果

根据由 ELM 研究中心维护的 Open Universal Arabic ASR 排行榜协议,Falcon-ASR 在六个测试集的加权平均指标上表现优异。较低的 WER 和 CER 数值代表更好的性能。

Model 参数 平均 WER (%) 平均 CER (%)
Falcon-ASR 1.6B 20.92 8.79
Audar-ASR-V1-Turbo 2.35B 23.17 9.23
Cohere Transcribe Arabic (07-2026) 2.0B 25.87 11.80
omniASR LLM 7B 7.0B 28.32 12.52

注:WER = 词错误率;CER = 字符错误率。数值越低表示性能越好。

此次评估基于排行榜固定表格进行。竞争对手的数据取自 2026 年 9 月 30 日检查的公开排行榜平均值。Falcon-ASR 的平均 WER 比该快照中公布的最佳结果高出 2.25 个百分点的优势区间(原文表述为优于最佳结果,此处保留原意逻辑,即数值更低更优,原文“优于”指代性能更好,数值上表现为差值优势)。

阿联酋方言专项评估

虽然公共评估数据如 Casablanca 数据集已包含阿联酋子集,但 TII 通过引入额外的阿联酋及海湾地区演讲记录进行了补充评估。这些内部测试使用了专门的测试记录和经过人工审核的参考文本。

在内部阿联酋评估中,Falcon-ASR 取得了以下成绩:

Model 参数 WER (%) CER (%)
Falcon-ASR 1.6B 22.73 10.19
Qwen3-Omni-30B-A3B-Instruct 30.0B (3.0B active) 26.80 12.72
Audar-ASR-V1-Turbo 2.35B 27.89 13.75
Cohere Transcribe Arabic (07-2026) 2.0B 31.05 18.07
Qwen3-ASR-1.7B-hf 2.0B 31.52 13.35
Audar-ASR-V1-Flash 0.78B 32.87 15.36

数据显示,Falcon-ASR 在所有对比系统中实现了最低的 WER 和 CER。其 WER 比次优系统 Qwen3-Omni 低 4.07 个百分点,表明其在词汇和字符层面的转录精度均有显著提升。

适应复杂录音环境

为了增强模型的鲁棒性,训练过程中引入了背景噪音、重叠语音、音乐、房间回声以及电话效果等多种干扰因素,并模拟了语速和音调的变化。这种处理方式同样应用于阿联酋方言数据的训练中,旨在让模型能够应对会议、电话及其他日常录音场景中可能遇到的各种声学条件。

多语言支持能力

Falcon-ASR 使用相同的模型权重处理英语转录任务。在 Hugging Face 开放 ASR 排行榜采用的七个公开英语测试集上,其平均 WER 为 5.74%。

测试套件 WER (%)
LibriSpeech clean 1.75
LibriSpeech other 4.21
SPGISpeech 2.02
VoxPopuli 3.87
GigaSpeech 8.15
AMI 8.33
Earnings-22 11.86

除阿拉伯语和英语外,该模型还支持法语、西班牙语和葡萄牙语。所有五种语言共享同一套权重,无需预先指定语言标识,输出结果为口语内容的直接转录文本。

技术基础

Falcon-ASR 建立在 Falcon3-Audio 的工作基础之上。关于 Falcon3-Audio 的架构设计及训练方法,可参阅论文《具有数据效率的公共数据单阶段培训的竞争性音频语言模型》。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读