Hugging Face推开源TTS多语言排行榜

Hugging Face推出开源TTS多语言排行榜。针对超8000个模型评估分散现状,新榜采用可理解性、速度等客观指标,将评估周期从数周缩短至数小时,为社区提供标准化参考。

开源 TTS 评估新标准:Hugging Face 推出可扩展的多语言排行榜

截至 2026 年 9 月 30 日,Hugging Face Hub 上可用的文本转语音(TTS)模型已超过 8000 个。尽管开源 TTS 模型的发布速度惊人,但评估体系却未能同步跟进,目前仍呈现分散且缺乏标准化的状态。

评估周期缩至数小时

长期以来,人类偏好评分(如 MOS 或 MUSHRA)被视为评估的黄金标准。社区中涌现出一些基于“竞技场”模式的排行榜作为参考,例如 TTS Arena v2、人工分析以及语音舞台。这些平台通过让用户对比两个模型的输出并投票,利用 Bradley-Terry 模型计算 Elo 分数来排名模型。

然而,人类偏好虽为最终决定因素,但竞技场模式难以跟上 TTS 发布的快节奏。数据显示,截至 2026 年 9 月 30 日,在人工分析的 92 个模型中,仅有 16 个是开放权重模型;语音竞技场上也存在类似的偏差。这主要源于实际操作的差异:接入 API 模型仅需密钥,而托管和运行开源模型则需要额外的基础设施投入,商业提供商比开源作者更有动力寻求展示位。此外,选民一致性也是局限之一,无法确保不同用户在不同时间点对“更好”的标准保持一致。

为此,Hugging Face 团队推出了开放的 TTS 排行榜,采用客观指标来评估模型表现的互补方面,将评估周期从数周缩短至数小时:

  • 可理解性:使用 Qwen3 ASR(目前在开放 ASR 排行榜排名第一的开源模型)计算提示与生成音频转录之间的字/字符错误率(WER 和 CER)。
  • 速度:在 H200 GPU 上进行批量离线推断时测量逆实时因子(RTFx),并在 H200 GPU 及 CPU 上量化流式传输(批量大小 1)的时间到第一个音频(TTFA)。
  • 说话人相似性:通过计算生成音频与参考剪辑之间 WavLM 说话人嵌入向量的余弦相似度(SIM)得出。

需要注意的是,该排行榜并非取代基于人类偏好的排名。ASR 驱动的 WER 仅作为可理解性的代理指标,说话人相似性则用于估计语音身份的保留情况。它们均不直接衡量听者感知的自然度、表现力或个人喜好,但能为以投票为基础的排行榜提供关于应包含哪些模型的参考信息。

多语言支持与语音克隆评估

在默认视图中,模型根据 Seed TTS Eval(论文)和 CV3 Eval(零样本)英语分区的宏观平均 WER 进行排名。在英语 WER 指标上,hexgrad/Kokoro-82M、Supertone/supertonic-3 和 fishaudio/s2-pro 在两个分区的平均值上领先。帕累托图可视化了各模型在 WER、批量推断效率(RTFx)和模型大小之间的平衡关系。

鉴于英语表现不一定能转化为其他语言的效果,用户可切换多种语言视图以查看多语言排名。由于 Seed TTS Eval 仅提供英语和中文音频,其他语言的成绩仅来自 CV3 Eval(零样本)。对于中文、日语和韩语等基于字符的语言,报告的是字符错误率(CER),跨语言的“平均 WER”则为各语言指标的宏观平均值。k2-fsa/OmniVoice、fishaudio/s2-pro 和 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 在多语言表现上较为强劲。

排行榜还支持语音克隆功能的比较。开启此选项后,表格将增加 SIM 列以显示说话人相似性,并提供新的帕累托图以可视化 SIM、批量推断和模型大小之间的权衡。部分模型如 bosonai/higgs-tts-3-4b 和 openbmb/VoxCPM2,在提供参考音频进行语音克隆时,其平均 WER 有所改善。

TTS 输出的比较与社区投票

为了弥补纯客观指标的不足,排行榜引入了“Listen”标签页,允许用户直接比较指标背后的生成输出,并选择更喜欢的模型。用户可以选择感兴趣的语言/数据集,并决定是否比较语音克隆功能。这一设计填补了现有 TTS 排行榜中缺乏模型输出探索空间的空白。

社区可以对生成的输出进行投票。随着选票数据的积累,这些数据可能会被纳入排行榜评估体系中。为确保数据质量,建议用户使用 Hugging Face 账户登录参与投票。

流媒体性能评估

“Streaming”标签页专门用于比较模型的流式处理能力。模型依据 TTFA(时间到第一个音频)进行排名,该指标量化了用户在探测模型后等待可播放音频所需的时间,这对语音代理和其他交互式应用至关重要。

对于支持流式 API 的模型,TTFA 指第一个音频块到达的时间;对于非流式模式,则指整个语音生成的时间,因为播放无法更早开始。测试环境统一为相同的 50 个英语提示(来自 CV3-Eval)、相同硬件及默认语音,批量大小为 1。前 3 次运行作为热身被剔除,报告其余运行的中位数 TTFA。默认视图展示 H200 GPU 上的性能,部分小型模型也提供了 CPU 结果。

结语

开放 TTS 排行榜旨在解决两大核心问题:一是纠正竞技场式评估对众多优秀开源模型的忽视,二是应对英语表现与其他语言表现不一致的挑战。评估脚本即将开源,类似于开放的 ASR 排行榜项目。社区反馈对于保持评估的相关性和洞察力至关重要,欢迎提出希望看到的数据集、模型和指标建议。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读