NVIDIA Nemotron 3 Diarization登顶VoiceArena,DER低至14.72%

NVIDIA Nemotron 3 Diarization登顶VoiceArena。该开放权重模型DER低至14.72%,支持8人重叠语音识别,较前代在精度与吞吐量上显著提升。

NVIDIA Nemotron 3 Diarization:在 VoiceArena 排行榜登顶,DER 低至 14.72%

说话人日记化的核心价值

语音交互包含两个维度的信息:内容(说了什么)与归属(谁说的)。虽然自动语音识别(ASR)能准确转录文本,但若缺乏对说话人的区分,会议记录、客户通话或播客摘要等应用场景将失去关键上下文——例如无法确定承诺方、异议者或打断者。这直接削弱了搜索、摘要生成、行动项提取及对话分析的有效性。

支持8人识别 DER降至14.72%

说话人日记化(Speaker Diarization)技术旨在识别每位说话人的活动时间段,包括重叠语音部分。结合 ASR 后,可生成带有说话人归属的完整转录稿。

NVIDIA 最新推出的 Nemotron 3 Diarization 是一款开放权重模型,参数量为 100M。该模型在 VoiceArena 的 Diarization-Bench 排行榜中位列第一,日记错误率(DER)为 14.72%。它支持现场和录制对话中多达八个说话人的识别,具备处理重叠语音、灵活分块处理长录音以及可定制流式延迟的能力。

相较于早期仅支持四个说话人的 NVIDIA Streaming Sortformer(如基线模型 diar_streaming_sortformer_4spk-v2.1),Nemotron 3 将支持范围扩展至八个说话人,并在精度与吞吐量上实现了显著提升。

Nemotron 3 的技术架构与应用模式

离线与流式双模支持

音频系统需解决两大挑战:一是检测语音并分配给正确的说话人;二是在整个对话过程中维持这种分配的连续性,即便面对沉默、中断或长时间间隔。

流式处理加剧了第二项挑战的难度。离线模型可全局审视录音,而流式系统仅接收有限的新音频片段。若缺乏有效的记忆机制,当前块中的说话人通道可能在下一块中被重新分配。Nemotron 3 沿用了 Sortformer 的方法,依据首次出现的时间顺序对输出说话人进行排序:第一个新声音对应第一个通道,后续新声音依次类推。这种基于到达时间的排序策略确保了通用说话人标签的稳定性,消除了每个数据块重新计算说话人排列的需求。

训练数据涵盖公开授权语音及来自 David AI 的多说话人标注真实对话。引入 David AI 提供的 21 种语言的大规模模拟英语和多语言混合音频后,复合日记错误率(DER)降低了 0.77 个百分点,从 11.19% 降至 10.42%,这一改进在线模式和超低延迟操作点中均得到体现。

该模型支持最多 8 个匿名说话人通道。这些标签仅代表时间线上的活动区间,而非现实身份。下游应用可通过结合会议元数据、用户配置文件或主动说话人验证模型,将这些匿名 ID 映射为具体身份。

从音频到说话人活动的转换流程

模型输入为 16 kHz 单声道音频,首先转换为 Mel-频谱图特征,步长为 10 ms。随后通过叠加八倍采样,送入带有旋转位置嵌入(RoPE)的 31 层 Transformer 编码器,最终产生分辨率为 80 ms 的特征表示。

Transformer 上方的 Conv1D 层将预测结果提升至输入特征分辨率。默认输出为一个 [T, 8] 浮点张量,其中 T 代表时间步数,8 代表可能的说话人通道。每个数值表示特定说话人在该时刻活跃的概率。默认步幅为 10 ms,可配置为其他倍数。

这种概率表示法天然支持重叠语音处理:若两人同时说话,对应的两个通道可同时处于活跃状态。后处理阶段将这些概率转换为具有开始和结束时间的通用说话人标签。

在流式推理中,两种记忆机制提供上下文支持:

  • 到达顺序说话人缓存 (AOSC):保留早期块中观察到的说话人信息,并按频道到达顺序组织。
  • 先进先出 (FIFO) 队列:提供当前块之前的最新背景音频。

输入缓冲区还包含“右上下文”,即当前块之后的音频。更丰富的上下文有助于解释说话人转换,但会增加等待时间。通过调整当前块、右上下文、FIFO 队列和说话人缓存的组合,模型可在多个延迟点上运行。分片推断消除了固定最大音频时长的限制,但在异常长录音或严重噪音、混响、远场捕捉及域移情况下,性能仍可能下降。

日记化与多说话人 ASR 的区别

独立的日记化任务仅输出说话人的活动时间戳,不涉及文本内容;而 ASR 生成文本但不一定保留说话人归属。完整的带说话人归属转录管道需结合两者输出。

系统设计时需明确区分这两类错误:日记错误包括漏检语音、误报语音、错误的说话人分配及边界误差;这些错误虽不直接影响文字转录,但会破坏归属关系。应用程序应根据预期音频场景分别评估组件及组合管道的表现。

平衡延迟与准确性

同一模型支持多种输入缓冲延迟配置,分别为 30.4 秒、1.04 秒、0.64 秒和 0.32 秒。较短的缓冲区响应更快,但更多的上下文通常能提升准确性和吞吐量。上述数值仅指推断前的音频缓冲时间,端到端延迟还需计入网络传输、ASR 计算及应用处理时间。尽管技术上可使用 80 ms 输入缓冲,但 0.32 秒是推荐的最低配置。

基准测试结果:VoiceArena 排名第一

在 VoiceArena 的 Diarization-Bench v1 初步结果中,NVIDIA Nemotron 3 Diarization 在 12 个系统和 17 个配置中排名第一。测试涵盖 139 个英语对话,总时长约 22 小时。在考虑重叠语音得分、使用系统生成的语音活动检测且无边界容差的情况下,其 DER 为 14.72%,比排名第二的系统(19.3%)相对降低约 24%。此外,它在 100 ms 和 250 ms 领口设置下,以及现场和在线录音场景中均位居榜首。需注意,随着 Voice Arena 完成 v1 版本评估及统计分析,初步结果可能会有变动。

下图展示了 Nemotron 3 与 NVIDIA 前代四扬声器流式 Sortformer 基线的对比,基于披露的分数和吞吐量设置。

在 1.04 秒输出延迟下,Nemotron 3 在八个公共基准测试中展现了最新的 DER 性能优势。

日记化准确率评估方法

主要评估指标为日记错误率(DER),由以下三类错误组成:

  • 漏检语音:参考标准中有说话人活跃,但系统未检测到。
  • 误报语音:参考标准中无语音,但系统标记某说话人为活跃。
  • 说话人混淆:系统在正确时间检测到语音,但分配给了错误的说话人。

DER 的计算方式为上述错误总和除以参考说话时间总数。对于重叠语音,每个参考说话人均计入分母。基准设置对 DER 影响显著,因此评估协议本身也是结果的一部分。Nemotron 3 的评估包含 901 种特定条件的录音,涵盖多语言电话、会议、近场/远场麦克风、多麦克风捕捉及困难声学环境。

DIHARD III、AliMeeting、AMI 和 NOTSOFAR1 数据集采用零秒领口(zero-second collar),即不允许边界宽容度。CALLHOME-Part2 采用 0.25 秒领口。结果通过 NeMo e2e_diarize_speech.py 脚本生成。对比基线为 diar_streaming_sortformer_4spk-v2.1。

性能提升:平均 DER 降低 40%

在 1.04 秒输入缓冲延迟下,Nemotron 3 在所有列出的八个评估条件下均降低了 DER。相对降幅从 CALLHOME-Part2 的 9.0% 到 NOTSOFAR1 MHM 的 65.2% 不等。八个数据集的未加权平均相对降幅为 41.0%。此数值为各条件相对改进的平均值,并非聚合 DER。

这种改进在不同操作点保持一致。在两个模型共享的每个延迟时间点(30.4、1.04 和 0.32 秒),最终模型在每个评估数据集上的全集 DER 均低于前代基线。

不同输入缓冲延迟下的全集 DER 对比显示,前代基线不支持 0.64 秒配置。

高说话人数量场景的优势

支持 8 个说话人使其适用于超过 4 名参与者的会议和小组讨论。在 DIHARD III、CALLHOME-Part2 和 NOTSOFAR1 的高说话人数量子集中,基准优势进一步扩大。

在 30.4 秒输入缓冲延迟下,按说话人数量分组的 DER 对比显示,阴影区域代表超过 4 个说话人的情况。

值得注意的是,在双扬声器 CALLHOME 子集上,最终模型 DER 为 5.98%,略高于前代基线的 5.68%。然而,在 CALLHOME-Part2 完整评估中,DER 从 10.32% 优化至 9.10%,且在更高说话人数量的子集中获得了更大收益。五到九个说话人的录音被合并统计,由于九个说话人超过了 Nemotron 3 支持的最大八个通道,该统计包含了超出指定限制之外的音频数据。

精度与吞吐量平衡

可部署的日记系统需兼顾准确性与吞吐量。模型卡报告实时加速因子(RTFx),计算公式为总音频持续时间除以总处理时间。较高的 RTFx 意味着单位计算时间内处理的音频更多。

第 9 图展示了 DIHARD III 全集 DER 与批量大小 32 编译吞吐量的关系。测试环境为 NVIDIA RTX PRO 5000,使用 BF16 精度及 NeMo PyTorch 后端。

在 30.4 秒配置下,Nemotron 3 Diarization 在 torch.compile 批量大小 32 时达到 15,113× RTFx,远高于前代基线的 2,619×,同时将 DIHARD III DER 从 19.09% 降至 12.73%。在 1.04 秒配置下,RTFx 达到 865×(基线为 136×),DER 从 19.60% 降至 13.18%。

这些数据反映的是公开测试系统的批量吞吐量,不应直接解读为单一数据流的端到端应用延迟。开发人员应在目标硬件上对整个管道(包括数据移动、日记化、ASR 及下游处理)进行基准测试。

实际应用演示

Nemotron Diarization 实时模型演示允许用户连接说话人时间戳与可跟踪的对话。应用提供合成对话、八说话人模式、实时麦克风输入及压力测试场景。新增的多语言 ASR 实时麦克风功能支持不同语言说话人的流式日记化处理。

用户可从预加载主题的“Conversation”模式开始,观察说话人活动和实时转录。也可使用“Live Mic”或“Multilingual Live Mic”进行自己的对话测试,或在“Audio File”标签页上传预录音频。

以下虚构示例说明了说话人归属的重要性(非演示实测输出):

无说话人归属 有说话人归属
"I’ll send the report." "Can you include the figures?" "Yes, by Friday." speaker_0: "I’ll send the report."
speaker_1: "Can you include the figures?"
speaker_0: "Yes, by Friday."

带有说话人标签后,应用可将承诺与回答后续问题的参与者关联起来。时间轴提供了纯文本无法展示的信息:两个说话人可同时活跃。下游摘要器可利用归属转录稿提取行动项,同时保留源说话人和时间戳。

预设场景使用合成音频。部分八说话人场景在 audible 对话前提供简短的说话人上下文介绍,旨在说明在该上下文下的行为表现,并非无上下文的基准测试。参与者姓名和角色属于应用逻辑,Nemotron 3 仅提供通用说话人通道和时间戳,不进行身份验证。

设备端实时说话人感知转录

Argmax 已在 Argmax Pro SDK 3 中添加了对 NVIDIA Nemotron 3 Diarization 的支持,实现多达八个说话人的实时归属,并推出了预日记化转录 API。该 API 在语音识别前分离说话人,旨在改善复杂重叠语音对话的转录效果。

快速入门指南

安装依赖

在设置 Python 3.12 或更高版本、Cython 及近期 PyTorch 版本后,安装系统包和 NVIDIA NeMo 语音依赖。

apt-get update && apt-get install -y libsndfile1 ffmpeg
uv pip install Cython packaging
uv pip in

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读