Skip to main content
QUICK REVIEW

[论文解读] Speaker Recognition using Deep Belief Networks

Adrish Banerjee, Akash Dutt Dubey|arXiv (Cornell University)|May 9, 2018
Speech Recognition and Synthesis参考文献 16被引用 8
一句话总结

本文提出一种基于深度置信网络(DBN)的方法,通过从原始语音信号中学习短期频谱特征,并将其与传统的MFCC特征结合,以提升说话人识别性能。该方法在ELSDSR数据集上达到95%的准确率,较仅使用MFCC特征时高出5个百分点,表明DBN学习到的特征能更有效地建模语音的统计结构,从而提升说话人识别效果。

ABSTRACT

Short time spectral features such as mel frequency cepstral coefficients(MFCCs) have been previously deployed in state of the art speaker recognition systems, however lesser heed has been paid to short term spectral features that can be learned by generative learning models from speech signals. Higher dimensional encoders such as deep belief networks (DBNs) could improve performance in speaker recognition tasks by better modelling the statistical structure of sound waves. In this paper, we use short term spectral features learnt from the DBN augmented with MFCC features to perform the task of speaker recognition. Using our features, we achieved a recognition accuracy of 0.95 as compared to 0.90 when using standalone MFCC features on the ELSDSR dataset.

研究动机与目标

  • 通过利用深度置信网络从语音信号中学习判别性短期频谱特征,以提升说话人识别性能。
  • 解决仅依赖手工设计特征(如MFCC)的局限性,这些特征可能无法完全捕捉语音中复杂的统计模式。
  • 探究使用DBN进行生成式预训练是否能产生比传统方法更鲁棒的说话人表征。
  • 在标准基准数据集上验证结合DBN学习特征与MFCC的混合特征表示的有效性。

提出的方法

  • 作者使用在原始语音帧上通过贪婪逐层无监督学习方法预训练的深度置信网络(DBN),以提取分层的、低层次的频谱表征。
  • DBN在短期语音片段上进行训练,以学习紧凑的、高维的表征,从而捕捉语音信号的统计结构。
  • 从DBN的可见层提取学习到的特征,并将其与标准MFCC特征拼接,形成混合输入表征。
  • 使用分类器(可能是Softmax或SVM)在拼接后的特征向量上进行训练,以实现说话人识别。
  • 在ELSDSR数据集上评估模型,该数据集是说话人识别的标准基准。
  • 对DBN进行有监督微调,以进一步优化其特征表征,使其更适合说话人分类任务。

实验结果

研究问题

  • RQ1深度置信网络能否有效从原始语音信号中学习判别性短期频谱特征,以用于说话人识别?
  • RQ2当将DBN学习到的特征与传统MFCC特征结合时,说话人识别系统的性能相较于仅使用MFCC特征有何提升?
  • RQ3DBN中的生成式预训练与分层特征学习在多大程度上增强了对语音统计结构的建模能力,从而提升说话人识别效果?
  • RQ4混合特征表征(DBN + MFCC)是否在标准基准上带来可测量的识别准确率提升?

主要发现

  • 所提出的方法在ELSDSR数据集上实现了95%的说话人识别准确率,显著优于仅使用MFCC的基线系统。
  • 仅使用MFCC的基线系统准确率为90%,表明引入DBN学习到的特征使准确率提升了5个百分点。
  • 结果表明,DBN学习到的特征比单独使用MFCC更能捕捉判别性和鲁棒的说话人特征。
  • 混合特征表征(DBN特征 + MFCC)有助于提升泛化能力,并改善对语音信号潜在统计结构的建模。
  • DBN的成功表明,对原始语音数据进行无监督预训练可生成对说话人识别任务有意义的表征。
  • 本研究证实,深度生成模型可有效补充传统手工设计的特征,在音频处理应用中发挥积极作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。