Skip to main content
QUICK REVIEW

[论文解读] Improved Deep Speaker Feature Learning for Text-Dependent Speaker Recognition

Lantian Li, Yiye Lin|arXiv (Cornell University)|Jun 28, 2015
Speech Recognition and Synthesis参考文献 5被引用 6
一句话总结

该论文通过引入依赖音素的DNN以减少音素差异,并提出动态时间规整(DTW)和段落池化以实现更优的时序建模,从而改进了文本相关说话人识别中的深度说话人特征学习。该方法将最佳短语的EER从基线d-vector的10.29%显著降低至8.14%,在与PLDA结合时,部分情况下优于i-vector基线。

ABSTRACT

A deep learning approach has been proposed recently to derive speaker identifies (d-vector) by a deep neural network (DNN). This approach has been applied to text-dependent speaker recognition tasks and shows reasonable performance gains when combined with the conventional i-vector approach. Although promising, the existing d-vector implementation still can not compete with the i-vector baseline. This paper presents two improvements for the deep learning approach: a phonedependent DNN structure to normalize phone variation, and a new scoring approach based on dynamic time warping (DTW). Experiments on a text-dependent speaker recognition task demonstrated that the proposed methods can provide considerable performance improvement over the existing d-vector implementation.

研究动机与目标

  • 解决现有d-vector系统在文本相关说话人识别中的局限性,即性能落后于i-vector基线。
  • 通过将音素后验概率引入DNN输入,减少音素变异对说话人特征学习的影响。
  • 通过利用语音中被标准d-vector平均方法忽略的时序约束,改进评分方法。
  • 探索能更好建模固定短语语音时序动态的判别性评分方法。
  • 证明将改进后的d-vector系统与i-vector系统结合可实现最先进性能。

提出的方法

  • 将音素后验概率作为DNN的输入特征,实现音素依赖的学习,减少语音变异性对说话人嵌入的影响。
  • 用段落池化替代平均池化,将语音分成固定长度的段,并为每个段生成d-vector。
  • 应用动态时间规整(DTW)对段级d-vector进行对齐和评分,保留帧之间的时序关系。
  • 使用包含40维倒谱倒谱系数特征和音素后验概率作为输入的多层DNN,从最后一层隐藏层提取帧级特征。
  • 在基线系统中应用PLDA和LDA进行判别性评分,但因d-vector本身具有判别性,故省略这些步骤。
  • 通过分数级插值将最佳d-vector系统(DNN+PT+DTW)与i-vector系统结合,以提升性能。

实验结果

研究问题

  • RQ1将音素后验概率引入DNN输入是否能通过减少与音素相关的变异性来改善说话人嵌入质量?
  • RQ2与简单平均池化相比,段落池化或基于DTW的评分是否能提升文本相关说话人识别的性能?
  • RQ3改进后的d-vector系统是否能在文本相关任务中超越或媲美i-vector基线?
  • RQ4通过分数级融合将增强的d-vector系统与i-vector系统结合,性能增益如何?
  • RQ5所提出的方法在固定内容的不同测试短语中对EER的影响如何?

主要发现

  • 引入音素后验概率(DNN+PT)对d-vector EER有微小改善,将P1短语的EER从10.29%降低至10.24%。
  • 段落池化(DNN+PT+SEG)将P1短语的EER降低至9.95%,在所有短语中均表现出一致的性能提升。
  • 基于DTW的评分(DNN+PT+DTW)实现了最佳单系统性能,将P1短语的EER降低至9.14%,P5短语降低至8.14%。
  • 通过分数插值将最佳d-vector系统(DNN+PT+DTW)与i-vector系统(PLDA)结合,P1短语的EER最低达到1.52%。
  • 联合系统优于两个独立系统,与仅使用i-vector基线相比,P2短语的EER降低最多达1.2个百分点,P4短语降低0.8个百分点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。