Skip to main content
QUICK REVIEW

[论文解读] The DKU-DukeECE-Lenovo System for the Diarization Task of the 2021 VoxCeleb Speaker Recognition Challenge

Weiqing Wang, Danwei Cai|arXiv (Cornell University)|Sep 5, 2021
Speech Recognition and Synthesis参考文献 23被引用 19
一句话总结

本论文针对2021年VoxCeleb说话人识别挑战赛提出了一套混合说话人分割系统,整合了语音活动检测(VAD)、说话人嵌入、聚类以及新颖的重叠检测方法。其核心创新在于提出了一种双说话人目标说话人语音活动检测(TS-VAD)模型,可识别说话人对之间的重叠语音,显著减少漏检说话人错误,并在测试集上实现了5.07%的分割错误率(DER),在挑战赛中排名第一。

ABSTRACT

This report describes the submission of the DKU-DukeECE-Lenovo team to the VoxCeleb Speaker Recognition Challenge (VoxSRC) 2021 track 4. Our system including a voice activity detection (VAD) model, a speaker embedding model, two clustering-based speaker diarization systems with different similarity measurements, two different overlapped speech detection (OSD) models, and a target-speaker voice activity detection (TS-VAD) model. Our final submission, consisting of 5 independent systems, achieves a DER of 5.07% on the challenge test set.

研究动机与目标

  • 通过改进重叠检测,降低真实世界重叠语音场景下的分割错误率(DER)。
  • 解决传统分割系统因无法检测重叠语音而导致的漏检说话人错误。
  • 开发一种灵活、与说话人无关的重叠检测方法,无需假设说话人数量固定。
  • 通过多模型融合与数据增强提升系统鲁棒性。
  • 在VoxSRC 2021挑战赛中实现最先进性能,特别是在处理重叠语音方面。

提出的方法

  • 采用ResNet34-BiLSTM架构进行VAD、重叠检测与TS-VAD,结合统计池化与Sigmoid输出,实现帧级语音概率预测。
  • 提出一种双说话人TS-VAD模型,将说话人嵌入对输入TS-VAD网络,以检测两说话人之间的重叠语音区域,实现无需预先知晓说话人数量的检测。
  • 使用带全局统计池化的ResNet34前端与ArcFace损失提取说话人嵌入,基于VoxCeleb 1与2进行训练以提升鲁棒性。
  • 采用层次聚类(AHC)与基于LSTM的相似性结合谱聚类进行说话人聚类,超参数在DEV402上进行调优。
  • 采用多阶段训练策略进行TS-VAD:在模拟Librispeech数据上预训练,迁移至VoxConverse,最后在DEV402上使用MUSAN与RIRs进行数据增强后微调。
  • 通过DOVER-Lap与基于排名的加权方式进行系统融合,整合五个独立系统,提升鲁棒性与最终DER。

实验结果

研究问题

  • RQ1双说话人TS-VAD模型是否能有效检测任意说话人对之间的重叠语音区域,而无需假设说话人数量固定?
  • RQ2整合多种重叠检测方法(VAD、TS-VAD、双说话人TS-VAD)如何提升整体分割性能?
  • RQ3使用MUSAN与RIRs进行数据增强在真实世界分割设置中能在多大程度上提升模型泛化能力?
  • RQ4多模型融合系统(DOVER-Lap)是否能带来比单个系统更好的泛化能力与更低的DER?
  • RQ5多阶段训练与迁移学习策略是否能有效将TS-VAD模型从模拟数据适配至真实世界数据?

主要发现

  • 所提出的双说话人TS-VAD模型成功检测任意说话人对之间的重叠语音,实现无需事先知晓说话人数量的检测。
  • 最终系统通过DOVER-Lap与基于排名的加权方式融合五个独立模型,在VoxSRC 2021测试集上实现5.07%的分割错误率(DER),在挑战赛中排名第一。
  • 双说话人TS-VAD方法通过准确识别重叠区域,显著减少了漏检说话人错误,对整体性能提升贡献显著。
  • DOVER-Lap融合提升了系统鲁棒性与泛化能力,优于单个系统及早期融合方法(后者在验证集上出现过拟合迹象)。
  • 多阶段训练策略——在Librispeech上预训练,迁移至VoxConverse,最后在DEV402上微调——有效实现了TS-VAD模型向真实世界条件的适应。
  • 使用MUSAN与RIRs进行数据增强提升了模型在多样化声学条件下的鲁棒性,尤其显著改善了VAD与TS-VAD模型的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。