Skip to main content
QUICK REVIEW

[论文解读] Deep Discriminant Analysis for i-vector Based Robust Speaker Recognition

Shuai Wang, Zili Huang|arXiv (Cornell University)|May 3, 2018
Speech Recognition and Synthesis参考文献 25被引用 3
一句话总结

该论文提出深度判别分析(DDA),一种基于非线性神经网络的i-vector说话人识别补偿方法,通过联合优化Softmax损失与中心损失来增强判别能力。与线性LDA不同,DDA学习一种非线性投影,以减少说话人内部差异并增加说话人间的分离度,在SRE语料库数据集上使用欧氏距离评分实现了4.69%的EER,优于LDA与PLDA的表现。

ABSTRACT

Linear Discriminant Analysis (LDA) has been used as a standard post-processing procedure in many state-of-the-art speaker recognition tasks. Through maximizing the inter-speaker difference and minimizing the intra-speaker variation, LDA projects i-vectors to a lower-dimensional and more discriminative sub-space. In this paper, we propose a neural network based compensation scheme(termed as deep discriminant analysis, DDA) for i-vector based speaker recognition, which shares the spirit with LDA. Optimized against softmax loss and center loss at the same time, the proposed method learns a more compact and discriminative embedding space. Compared with the Gaussian distribution assumption of data and the learnt linear projection in LDA, the proposed method doesn't pose any assumptions on data and can learn a non-linear projection function. Experiments are carried out on a short-duration text-independent dataset based on the SRE Corpus, noticeable performance improvement can be observed against the normal LDA or PLDA methods.

研究动机与目标

  • 解决线性LDA在i-vector说话人识别中的局限性,特别是其对数据服从高斯分布的假设以及无法建模非线性可分性的问题。
  • 开发一种LDA的非线性替代方法,以更好地捕捉真实场景下复杂的说话人差异与信道退化。
  • 通过学习更紧凑且更具判别性的嵌入空间,提升短时长、文本无关语音样本的说话人识别性能。
  • 证明结合余弦或欧氏距离等简单评分方法时,基于神经网络的方法可超越传统的PLDA与LDA系统。

提出的方法

  • 提出一个深度神经网络,通过多层结构(使用PReLU激活函数与批量归一化)将高维i-vector(600D)映射到低维判别空间(如300D或400D)。
  • 使用联合损失函数进行网络训练,结合Softmax损失(以最大化类间分离)与中心损失(通过将嵌入拉向类别中心以最小化类内差异)。
  • 采用独立的学习率进行优化:主网络学习率为0.01,中心参数学习率为0.1,并在每个小批量中更新中心参数,以提升训练稳定性。
  • 通过λ = 0.01的加权损失组合平衡两项目标,确保网络在不退化为不可区分嵌入空间的前提下学习到有意义的判别特征。
  • 使用t-SNE可视化方法定性评估DDA变换后说话人内部嵌入的紧凑性以及说话人间的分离程度。
  • 在SRE语料库上评估该方法,采用余弦与欧氏距离评分,与基线i-vector、LDA及PLDA系统进行对比。

实验结果

研究问题

  • RQ1深度神经网络能否在不假设数据服从高斯分布的前提下,通过学习非线性、更具判别性的投影,有效替代i-vector空间中的线性LDA?
  • RQ2联合优化Softmax损失与中心损失相比标准LDA或PLDA,如何提升说话人识别性能?
  • RQ3在短时长、文本无关的说话人识别任务中,DDA嵌入空间的最优维度是多少,才能实现最小EER?
  • RQ4DDA模型对平衡Softmax损失与中心损失的超参数λ的敏感性如何?收敛与性能最优的设置是什么?

主要发现

  • 使用欧氏距离评分时,DDA实现了4.69%的EER,优于基线PLDA系统(EER 4.96%)与LDA(EER 5.22%)在SRE语料库上的表现。
  • DDA在400维嵌入空间中表现最佳,此时EER降至4.51%(欧氏距离评分),而LDA在200D时表现最佳。
  • 当λ设置为0.01时,训练稳定且性能最优;若λ设为0.1,则因中心损失主导导致网络无法训练。
  • t-SNE可视化结果表明,DDA显著降低了说话人内部差异,使同一说话人的嵌入更加紧凑,并与其它说话人更好分离。
  • DDA在所有测试的嵌入维度上均优于LDA,尤其在欧氏距离评分中相对提升最大(例如在300D时,DDA的EER为4.69%,而LDA为5.22%)。
  • 所提方法与PLDA不兼容,表明DDA的非线性补偿可能已在嵌入空间中完全取代了PLDA的作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。