Skip to main content
QUICK REVIEW

[论文解读] Deep Neural Network Embedding Learning with High-Order Statistics for Text-Independent Speaker Verification.

Lanhua You, Wu Guo|arXiv (Cornell University)|Mar 28, 2019
Speech Recognition and Synthesis参考文献 12被引用 4
一句话总结

本文提出了一种用于x-vector说话人嵌入的多任务学习框架,通过联合优化从原始语音样本中重建高阶统计量与说话人分类,实现端到端的训练。通过整合有监督与无监督信号,该方法在仅增加极少计算开销的前提下,显著提升了嵌入的判别性与鲁棒性,在NIST SRE16和VOiCES数据集上的表现优于标准x-vector系统。

ABSTRACT

The x-vector based deep neural network (DNN) embedding systems have demonstrated effectiveness for text-independent speaker verification. This paper presents a multi-task learning architecture for training the speaker embedding DNN, with the primary task of classifying the target speakers and the auxiliary task of reconstructing the higher-order statistics of the original input utterance. The proposed training strategy aggregates both the supervised and unsupervised learning into one framework to make the speaker embeddings more discriminative and robust. Experiments are carried out in the NIST SRE16 evaluation dataset and the VOiCES dataset. The results demonstrate that our proposed method outperform the original x-vector approach with very low additional complexity added.

研究动机与目标

  • 通过利用有监督与无监督学习信号,提升文本无关说话人验证的性能。
  • 解决标准x-vector系统仅依赖说话人分类进行嵌入学习的局限性。
  • 通过辅助重建输入语音样本的高阶统计量,增强嵌入的鲁棒性与判别性。
  • 开发一种整合有监督与无监督目标的训练框架,且不会显著增加模型复杂度。

提出的方法

  • 提出一种多任务学习架构,主任务为说话人分类,辅助任务为重建输入语音样本的高阶统计量。
  • 在训练过程中,使用输入声学特征的高阶统计量(如三阶与四阶矩)作为监督信号。
  • 训练深度神经网络,使其在共享编码器主干网络的基础上,联合优化说话人身份分类与这些统计特征的重建。
  • 在高阶统计量上应用重建损失,以促使网络保留更具判别性与鲁棒性的表示。
  • 采用共享的瓶颈层(x-vector)进行说话人嵌入提取,该层在两个任务间共享。
  • 训练目标结合了说话人分类的交叉熵损失与统计重建的均方误差损失。

实验结果

研究问题

  • RQ1重建语音样本的高阶统计量是否能提升文本无关验证中说话人嵌入的判别性?
  • RQ2联合学习说话人分类与统计重建对通道与环境变化的鲁棒性有何影响?
  • RQ3添加无监督辅助任务对x-vector系统性能的影响如何,且计算成本是否可忽略?
  • RQ4所提出的多任务框架是否能在NIST SRE16与VOiCES等多样化评估集上实现良好泛化?

主要发现

  • 所提方法在NIST SRE16评估数据集上的表现优于标准x-vector系统。
  • 该方法在VOiCES数据集上也优于基线模型,表明其在多样化录音条件下的鲁棒性。
  • 性能提升仅带来极低的额外计算复杂度,具备实际部署的可行性。
  • 将高阶统计量作为辅助任务整合,显著增强了学习到的说话人嵌入的判别能力。
  • 结果证实,来自高阶统计量的无监督信号能有效提升嵌入质量,且无需额外标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。