Skip to main content
QUICK REVIEW

[论文解读] USTC-NELSLIP System Description for DIHARD-III Challenge

Yuxuan Wang, Maokui He|arXiv (Cornell University)|Mar 19, 2021
Speech Recognition and Synthesis参考文献 21被引用 20
一句话总结

本论文介绍了USTC-NELSLIP系统在DIHARD-III语音分割挑战中的应用,提出了迭代语音分离(ISS)和迭代目标说话人VAD(ITS-VAD),以提升在噪声多说话人环境下的分割性能。通过结合领域相关处理、音频领域分类和模型融合,该系统在赛道1上实现了11.30%的DER,在赛道2上实现了16.78%的DER,相较于基线聚类系统相对提升了48.7%,在排行榜上排名第一。

ABSTRACT

This system description describes our submission system to the Third DIHARD Speech Diarization Challenge. Besides the traditional clustering based system, the innovation of our system lies in the combination of various front-end techniques to solve the diarization problem, including speech separation and target-speaker based voice activity detection (TS-VAD), combined with iterative data purification. We also adopted audio domain classification to design domain-dependent processing. Finally, we performed post processing to do system fusion and selection. Our best system achieved DERs of 11.30% in track 1 and 16.78% in track 2 on evaluation set, respectively.

研究动机与目标

  • 提升在存在重叠语音和背景噪声的复杂真实环境下的语音分割性能。
  • 通过领域分类和定制化处理流程,解决领域间差异对分割性能的影响。
  • 通过集成迭代语音分离(ISS)和迭代目标说话人VAD(ITS-VAD)系统,提升分割准确性。
  • 通过多系统融合与迭代数据净化,降低分割错误率(DER)。
  • 通过端到端与混合模块化方法,在DIHARD-III挑战中实现最先进性能。

提出的方法

  • 在10秒音频片段上训练了一个基于17层ResNet的音频领域分类器,用于识别11种不同的音频领域,其在开发集上的准确率达到100%。
  • 在RESTAURANT领域应用了渐进式多目标语音增强,每层增加10 dB信噪比(SNR),并使用PELPS和PRM特征进行增强。
  • 在250小时模拟双说话人Librispeech数据上训练了迭代语音分离(ISS)系统,以改善重叠语音中的说话人分离效果。
  • 基于增强的VoxCeleb数据进行i-vector提取,训练了迭代目标说话人VAD(ITS-VAD)系统,训练数据包含2500小时真实与模拟的多说话人语音。
  • 训练了多个SAD模型(DNN、CLDNN、TDNN),并通过加权投票方式进行融合,以提升语音活动检测的准确性。
  • 通过多轮迭代的ISS和ITS-VAD输出,使用dover-lap进行系统融合,最终结果通过后处理和领域特定路由选择。

实验结果

研究问题

  • RQ1迭代语音分离是否能在重叠且嘈杂的语音环境中显著提升分割性能?
  • RQ2迭代目标说话人VAD与传统基于聚类的分割方法相比,在多样化音频领域中的表现如何?
  • RQ3领域相关处理在异构真实录音中能在多大程度上提升分割鲁棒性?
  • RQ4语音增强、SAD融合与迭代优化相结合,对整体分割错误率有何影响?
  • RQ5通过dover-lap进行模型融合,是否能进一步降低多个迭代分割系统组合后的DER?

主要发现

  • USTC-NELSLIP系统在赛道1评估集上实现了11.30%的分割错误率(DER),相较于基线聚类系统相对提升了48.7%。
  • 在赛道2中,系统实现了16.78%的DER,显著优于基线系统在完整评估集上25.36%的DER。
  • 将基于ISS的系统与迭代训练及dover-lap融合结合后,DER从16.22%降低至8.31%,表明迭代优化带来了显著收益。
  • 三个SAD模型(DNN、CLDNN、TDNN)的融合将整体SAD错误率从基线的2.42%降低至完整开发集上的1.36%,显示出良好的互补性。
  • ITS-VAD系统在除RESTAURANT外的所有领域均优于基线聚类系统,而在RESTAURANT领域性能下降,主要因高噪声与重叠,这验证了领域特定路由的合理性。
  • 音频领域分类在开发集上达到100%准确率,实现了有效的领域感知处理与音频流的领域特定路由。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。