Skip to main content
QUICK REVIEW

[论文解读] Performance Evaluation of Statistical Approaches for Text Independent Speaker Recognition Using Source Feature

R. Rajeswara Rao, V. Kamakshi Prasad|arXiv (Cornell University)|Apr 25, 2011
Speech Recognition and Synthesis参考文献 14被引用 5
一句话总结

本文评估了统计方法——高斯混合模型(GMMs)和隐马尔可夫模型(HMMs)——在使用线性预测(LP)残差作为源特征提取说话人特异性激励信息的文本无关说话人识别中的应用。结果表明,连续同态HMM在TIMIT数据库上实现了接近100%的识别准确率,优于GMM,证明了HMM在建模激励分量用于说话人识别方面的有效性。

ABSTRACT

This paper introduces the performance evaluation of statistical approaches for TextIndependent speaker recognition system using source feature. Linear prediction LP residual is used as a representation of excitation information in speech. The speaker-specific information in the excitation of voiced speech is captured using statistical approaches such as Gaussian Mixture Models GMMs and Hidden Markov Models HMMs. The decrease in the error during training and recognizing speakers during testing phase close to 100 percent accuracy demonstrates that the excitation component of speech contains speaker-specific information and is indeed being effectively captured by continuous Ergodic HMM than GMM. The performance of the speaker recognition system is evaluated on GMM and 2 state ergodic HMM with different mixture components and test speech duration. We demonstrate the speaker recognition studies on TIMIT database for both GMM and Ergodic HMM.

研究动机与目标

  • 研究源特征(特别是LP残差)在捕捉文本无关说话人识别中说话人特异性信息方面的有效性。
  • 比较GMM与HMM在建模语音激励分量用于说话人识别方面的性能表现。
  • 评估混合成分数量和测试语音时长变化对识别准确率的影响。
  • 证明连续同态HMM在捕捉说话人特异性激励模式方面优于GMM。

提出的方法

  • 使用线性预测(LP)残差对浊音语音的激励分量进行建模,以捕捉与激励源相关的信息。
  • 从LP残差中提取说话人特异性特征,以表示语音信号中的源激励。
  • 在LP残差特征上训练高斯混合模型(GMMs),以建模说话人分布。
  • 应用两状态连续同态HMM来建模激励信号的时间动态特性,同时捕捉语音的频谱与时间域的说话人特征。
  • 在TIMIT数据库上,通过调整混合成分数量和测试时长,评估两种模型的性能。
  • 通过将测试语音的似然得分与每位说话人的模型模板进行比较,来衡量识别准确率。

实验结果

研究问题

  • RQ1线性预测残差能否有效表示文本无关说话人识别中说话人特异性激励信息?
  • RQ2GMM与HMM在建模说话人识别的激励分量方面表现如何比较?
  • RQ3混合成分数量和测试语音时长的变化对识别准确率有何影响?
  • RQ4连续同态HMM是否在从激励信号中捕捉说话人特异性特征方面优于GMM?

主要发现

  • 连续同态HMM实现了接近100%的识别准确率,显著优于GMM在说话人识别任务中的表现。
  • 从LP残差中提取的激励分量包含丰富的说话人特异性信息,可被统计模型有效捕捉。
  • 基于HMM的系统在性能上优于GMM,尤其在建模激励信号的时间动态特性方面表现更优。
  • 随着测试语音时长的增加,识别准确率提升,表明足够的语音时长对可靠说话人建模至关重要。
  • 无论混合成分数量如何变化,HMM相对于GMM的性能优势保持一致,凸显了HMM方法的鲁棒性。
  • 结果证实,当与适当的统计框架结合时,源特征在文本无关说话人识别中具有高度有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。