Skip to main content
QUICK REVIEW

[论文解读] Deep Speaker Vectors for Semi Text-independent Speaker Verification

Lantian Li, Dong Wang|arXiv (Cornell University)|May 24, 2015
Speech Recognition and Synthesis参考文献 5被引用 8
一句话总结

本文提出通过深度神经网络学习的深度说话人向量(d-vectors),用于半文本无关说话人验证,其中语音内容被限制在有限的短语集合内。通过在DNN训练中引入音素后验概率(音素相关训练),该方法在i-vector基线基础上实现了性能提升,尤其在结合非线性降维与得分融合后,最低EER达到7.14%。

ABSTRACT

Recent research shows that deep neural networks (DNNs) can be used to extract deep speaker vectors (d-vectors) that preserve speaker characteristics and can be used in speaker verification. This new method has been tested on text-dependent speaker verification tasks, and improvement was reported when combined with the conventional i-vector method. This paper extends the d-vector approach to semi text-independent speaker verification tasks, i.e., the text of the speech is in a limited set of short phrases. We explore various settings of the DNN structure used for d-vector extraction, and present a phone-dependent training which employs the posterior features obtained from an ASR system. The experimental results show that it is possible to apply d-vectors on semi text-independent speaker recognition, and the phone-dependent training improves system performance.

研究动机与目标

  • 将基于深度神经网络的说话人向量学习(d-vectors)从文本相关任务扩展至半文本无关说话人验证任务。
  • 探究是否可通过使用自动语音识别(ASR)系统生成的音素后验概率进行音素相关训练,来提升d-vectors在半文本无关场景下的性能。
  • 评估判别性归一化技术(LDA、PLDA)在d-vectors上的有效性,与i-vectors进行比较。
  • 探索结合d-vector与i-vector系统以提升说话人验证性能的潜力。
  • 评估d-vectors(本身具有判别性)是否仍能从线性或非线性降维技术中获益。

提出的方法

  • 训练DNN以从原始声学特征预测说话人身份,利用最后一层隐藏层的激活值作为d-vectors。
  • 通过将预训练ASR系统生成的音素后验概率拼接到DNN输入中,引入音素相关训练。
  • 通过在主DNN后插入一个小型隐藏层(100个单元)实现非线性降维(NLDR),以减少d-vectors中的冗余。
  • 在说话人验证中使用余弦距离、LDA和PLDA进行评分,比较i-vector与d-vector系统的性能。
  • 通过加权插值融合d-vector与i-vector得分,以提升整体系统性能。
  • 在包含多种短语的大型数据集上训练DNN,并在包含多种短语类型的半文本无关设置下进行评估。

实验结果

研究问题

  • RQ1在文本相关数据上训练的d-vectors能否有效泛化至半文本无关说话人验证任务?
  • RQ2将ASR系统生成的音素后验概率引入DNN输入(即音素相关训练)是否能提升d-vectors的性能?
  • RQ3判别性归一化方法(LDA、PLDA)对d-vectors系统的影响如何,与i-vectors系统相比有何差异?
  • RQ4非线性降维(NLDR)是否能通过去除冗余进一步提升d-vectors性能?
  • RQ5将最佳d-vector系统与i-vector系统进行得分融合,是否能获得优于单一系统的表现?

主要发现

  • 在使用简单余弦距离时,d-vectors系统优于i-vector基线,EER为13.58%,而i-vectors为19.32%。
  • 在应用PLDA后,i-vector系统超越了d-vector系统(EER:8.70% vs. 15.45%),表明判别性归一化对i-vectors的增益更大。
  • 采用d-vectors的音素相关训练将EER从13.58%(余弦)降低至13.21%,表明性能有持续但微弱的提升。
  • 非线性降维(NLDR)进一步提升了d-vectors性能,结合音素相关训练后EER降至12.79%。
  • 最佳d-vector系统(NLDR + 音素相关训练)与i-vector系统(PLDA)的组合实现了所有配置中的最低EER(7.14%)。
  • 结果表明,d-vectors本身已具备高度判别性,但通过NLDR与得分融合仍可有效缓解帧间不确定性和冗余。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。