Skip to main content
QUICK REVIEW

[论文解读] The DKU-DukeECE Diarization System for the VoxCeleb Speaker Recognition Challenge 2022

Weiqing Wang, Xiaoyi Qin|arXiv (Cornell University)|Oct 4, 2022
Speech Recognition and Synthesis被引用 4
一句话总结

本论文介绍了DKU-DukeECE系统在2022年VoxCeleb说话人识别挑战赛第4 Track中的表现,该系统通过在凝聚层次聚类(AHC)框架内融合多模型语音活动检测(VAD)、目标说话人VAD(TS-VAD)以及改进的说话人嵌入模型,实现了4.75%的分段错误率(DER),并凭借DOVER-Lap融合四种不同配置,显著降低了DER,从而获得第一名。

ABSTRACT

This paper discribes the DKU-DukeECE submission to the 4th track of the VoxCeleb Speaker Recognition Challenge 2022 (VoxSRC-22). Our system contains a fused voice activity detection model, a clustering-based diarization model, and a target-speaker voice activity detection-based overlap detection model. Overall, the submitted system is similar to our previous year's system in VoxSRC-21. The difference is that we use a much better speaker embedding and a fused voice activity detection, which significantly improves the performance. Finally, we fuse 4 different systems using DOVER-lap and achieve 4.75 of the diarization error rate, which ranks the 1st place in track 4.

研究动机与目标

  • 通过使用鲁棒的语音活动检测(VAD)和重叠检测,提升多说话人、重叠语音场景下的说话人分段性能。
  • 通过改进VAD模型并集成目标说话人VAD(TS-VAD)以更好检测重叠区域,降低分段错误率(DER)。
  • 通过伪标签和微调说话人嵌入模型,缓解训练集(VoxCeleb)与测试集(VoxConverse)之间的领域差异。
  • 通过DOVER-Lap融合多个分段系统,提升系统鲁棒性与泛化能力。
  • 在VoxSRC 2022说话人识别挑战赛第4 Track中实现最先进性能。

提出的方法

  • 通过多数投票方式融合四种不同的VAD模型——基于ResNet34、Conformer、pyannote.audio 2.0以及基于ASR的模型,以减少误报和漏检。
  • 采用基于SimAM-ResNet34的说话人嵌入模型,使用ArcFace损失函数,并在伪标签化的VoxConverse开发集上进行微调,以减小领域差距。
  • 提出一种目标说话人VAD(TS-VAD)模型,利用说话人嵌入检测特定目标说话人的语音段,该模型在模拟的Librispeech数据上训练,并在VoxConverse上进行微调。
  • 应用DOVER-Lap融合技术,整合四种系统变体:带重叠检测的AHC、部分/完全分配TS-VAD的AHC,以及带TS-VAD的LSTM谱聚类。
  • 使用MUSAN和RIR的在线数据增强技术,提升模型在多样化声学条件下的鲁棒性。
  • 采用混合推理策略:基于AHC的结果通过TS-VAD输出部分修正,以减少说话人混淆和过估计。

实验结果

研究问题

  • RQ1如何有效融合多个VAD模型,以在多说话人场景中降低分段错误率(DER)?
  • RQ2与标准VAD或仅重叠检测相比,目标说话人VAD(TS-VAD)在重叠检测和整体分段性能方面有多大的提升?
  • RQ3能否有效将预训练于VoxCeleb的说话人嵌入模型适配到VoxConverse测试集,以减小领域差异并降低DER?
  • RQ4在存在说话人混淆和过估计的情况下,DOVER-Lap融合多样化分段系统如何提升鲁棒性并降低DER?
  • RQ5使用MUSAN和RIR的数据增强对VAD和分段模型的泛化能力有何影响?

主要发现

  • 融合后的VAD系统相比单一VAD模型将DER降低了0.3%,在VoxConverse测试集上达到3.97%的错误率。
  • 基于AHC的分段系统结合TS-VAD在VoxConverse和挑战赛测试集上均实现了4.85%的DER,位列排行榜第一。
  • 通过DOVER-Lap融合四种不同系统,DER进一步降低至4.75%,在VoxSRC 2022第4 Track中获得第一名。
  • 与基线AHC结合标准重叠检测相比,TS-VAD模型将DER降低了约0.6%,证明其在处理重叠语音方面的有效性。
  • 尽管在VoxConverse上进行了微调,该说话人嵌入模型在挑战赛测试集上的表现仍劣于预训练的VoxCeleb2模型,因此最终推理采用后者。
  • 系统显著优于仅使用AHC的基线模型,后者存在严重过估计问题(例如,对10个说话人的片段预测超过30个说话人),通过部分TS-VAD分配修正了错误。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。