Skip to main content
QUICK REVIEW

[论文解读] Microsoft Speaker Diarization System for the VoxCeleb Speaker Recognition Challenge 2020

Xiong Xiao, Naoyuki Kanda|arXiv (Cornell University)|Oct 22, 2020
Speech Recognition and Synthesis参考文献 33被引用 6
一句话总结

本论文展示了微软在VoxSRC 2020挑战赛中表现最佳的说话人分割系统,结合了基于Conformer的连续语音分离模型、基于Res2Net的说话人嵌入提取器以及改进的DOVER融合方法。该系统在开发集上达到3.71%的DER,在测试集上达到6.23%的DER,凭借对重叠语音及分离模块中泄漏问题的有效处理,在分割任务中排名第一。

ABSTRACT

This paper describes the Microsoft speaker diarization system for monaural multi-talker recordings in the wild, evaluated at the diarization track of the VoxCeleb Speaker Recognition Challenge(VoxSRC) 2020. We will first explain our system design to address issues in handling real multi-talker recordings. We then present the details of the components, which include Res2Net-based speaker embedding extractor, conformer-based continuous speech separation with leakage filtering, and a modified DOVER (short for Diarization Output Voting Error Reduction) method for system fusion. We evaluate the systems with the data set provided by VoxSRCchallenge 2020, which contains real-life multi-talker audio collected from YouTube. Our best system achieves 3.71% and 6.23% of the diarization error rate (DER) on development set and evaluation set, respectively, being ranked the 1st at the diarization track of the challenge.

研究动机与目标

  • 解决在存在重叠语音和不利声学环境的真实多说话人录音中的说话人分割挑战。
  • 通过整合端到端语音分离、说话人嵌入与聚类流程,提升分割性能。
  • 减少由语音分离输出中残留噪声和音乐泄漏引起的误报。
  • 通过一种新型基于投票的融合方法增强系统鲁棒性与准确性,该方法能够有效处理重叠语音。
  • 在包含多样化真实YouTube录音的VoxSRC 2020挑战赛数据集上实现最先进性能。

提出的方法

  • 开发了一种基于Conformer的连续语音分离(CSS)系统,将重叠语音分离为两个输出通道,从而更好地处理同时说话的情况。
  • 采用基于Res2Net的神经网络,并结合加法边缘Softmax损失,以提取更具区分性的说话人嵌入,提升聚类准确率。
  • 应用泄漏过滤方法,通过使用基线系统中说话人聚类中心,从分离通道中去除残留噪声和音乐,以抑制误报。
  • 引入改进的DOVER算法以融合多个分割假设,将最佳系统设为根假设,最佳系统投票权重设为1.0,其余系统设为0.34。
  • 系统采用迭代假设对齐与加权投票机制,仅当总投票权重超过1.0阈值时,才保留时间区域。
  • 通过在开发集上进行网格搜索,对AHC停止阈值和最小说话人时长等超参数进行了优化。
Fig. 1 : System Diagram
Fig. 1 : System Diagram

实验结果

研究问题

  • RQ1基于Conformer的连续语音分离模型是否能有效提升重叠语音场景下的分割性能?
  • RQ2将基于Res2Net的说话人嵌入提取器与加法边缘损失结合,对说话人聚类准确率有何影响?
  • RQ3泄漏过滤在多大程度上可减少由分离通道中残留噪声和音乐引起的分割输出误报?
  • RQ4一种考虑重叠语音的改进DOVER融合方法,是否能优于标准融合技术在多系统分割中的表现?
  • RQ5系统组合对真实世界非约束录音中的分割错误率(DER)和Jaccard错误率(JER)有何影响?

主要发现

  • 最佳单系统(系统7)在开发集上达到3.71%的分割错误率(DER),在测试集上达到6.23%的DER,在VoxSRC 2020挑战赛中排名第一。
  • 加入泄漏过滤后,DER显著降低,证明其在抑制分离语音输出中误报方面的有效性。
  • 系统5(包含泄漏过滤)在开发集上达到23.97%的JER,经超参数调优后,系统6的JER降低至19.90%,表明分割准确率得到提升。
  • 系统8通过使用改进DOVER方法融合四个系统(以系统7为根假设),在测试集上虽JER略有下降,但DER相比系统7略有提升。
  • 改进的DOVER融合方法在存在重叠语音的情况下仍能有效组合系统,测试集上持续表现出性能增益。
  • 该系统在未见条件下的泛化能力表现出色,尽管仅允许提交4次,仍实现了测试集上的顶尖性能。
Fig. 2 : Statistics of recordings in development set, (a) histogram of overlap ratios; (b) histogram of number of speakers.
Fig. 2 : Statistics of recordings in development set, (a) histogram of overlap ratios; (b) histogram of number of speakers.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。