Skip to main content
QUICK REVIEW

[论文解读] HLT-NUS SUBMISSION FOR 2020 NIST Conversational Telephone Speech SRE

Rohan Kumar Das, Ruijie Tao|arXiv (Cornell University)|Nov 12, 2021
Speech Recognition and Synthesis参考文献 9被引用 7
一句话总结

本论文介绍了HLT-NUS团队在2020年NIST对话式电话语音说话人识别评估中的参赛方案,采用基于多种多语言语料库训练的TDNN x-vector与ECAPA-TDNN系统融合方法。通过领域自适应PLDA和自适应s-归一化技术提升性能,得分级融合使SRE20 CTS进展集的minDCF降低至0.190。

ABSTRACT

This work provides a brief description of Human Language Technology (HLT) Laboratory, National University of Singapore (NUS) system submission for 2020 NIST conversational telephone speech (CTS) speaker recognition evaluation (SRE). The challenge focuses on evaluation under CTS data containing multilingual speech. The systems developed at HLT-NUS consider time-delay neural network (TDNN) x-vector and ECAPA-TDNN systems. We also perform domain adaption of probabilistic linear discriminant analysis (PLDA) model and adaptive s-norm on our systems. The score level fusion of TDNN x-vector and ECAPA-TDNN systems is carried out, which improves the final system performance of our submission to 2020 NIST CTS SRE.

研究动机与目标

  • 应对在开放训练条件下多语言对话式电话语音(CTS)说话人识别的挑战。
  • 开发能够在多样化语言和声学条件下具备强泛化能力的说话人识别系统。
  • 在缺乏专用开发集的情况下,通过领域自适应与得分归一化技术提升性能。
  • 通过得分级融合探索TDNN x-vector与ECAPA-TDNN架构的互补优势。
  • 利用开放训练数据与最少的开发数据,在SRE20 CTS评估集上实现最先进性能。

提出的方法

  • 使用Kaldi工具包在Switchboard、SRE 2004–2016、Fisher、Mixer6、VoxCeleb1和VoxCeleb2数据集的组合上训练TDNN x-vector系统。
  • 通过MUSAN噪声与混响数据增强将训练集规模扩大一倍,提升鲁棒性。
  • 使用TDNN架构提取512维x-vectors,输入特征为23维MFCC并结合基于能量的VAD。
  • 采用LDA进行降维,PLDA用于打分,并利用SRE2018评估集进行领域自适应。
  • 在SRE2018评估集(前30%)上实施自适应s-归一化,以改善得分校准。
  • 基于VoxCeleb2预训练开发ECAPA-TDNN系统,结合SpecAugment与在线RIR/噪声增强,随后在SRE18和SRE19 CTS数据集上进行微调。

实验结果

研究问题

  • RQ1结合TDNN x-vector与ECAPA-TDNN架构的混合系统在多语言CTS说话人识别中的有效性如何?
  • RQ2PLDA模型的领域自适应在多语言CTS数据上的性能提升程度如何?
  • RQ3自适应s-归一化是否能有效减少开放集评估设置下actDCF与minDCF之间的差异?
  • RQ4在使用互补模型时,得分级融合对系统性能的影响如何?
  • RQ5不同训练数据组合在开放训练条件下的泛化能力影响如何?

主要发现

  • 在SRE20 CTS进展集上,ECAPA-TDNN系统的minDCF为0.239,低于TDNN x-vector系统的0.269。
  • 两套系统在得分级融合后,SRE20 CTS进展集的minDCF降低至0.190,优于任一单独系统。
  • 融合系统在SRE20 CTS进展集上的EER为4.53%,低于单独ECAPA-TDNN系统的5.35%。
  • PLDA模型的领域自适应显著提升了性能,尤其在降低多语言数据的minDCF方面效果明显。
  • 自适应s-归一化有助于缩小actDCF与minDCF之间的差距,但差异仍较大,表明仍有进一步改进校准的空间。
  • TDNN x-vector系统的实时因子为0.02,ECAPA-TDNN系统为0.05,表明其在标准硬件上具有高效的推理能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。