Skip to main content
QUICK REVIEW

[论文解读] HMM Speaker Identification Using Linear and Non-linear Merging Techniques

Unathi Mahola, Fulufhelo V. Nelwamondo|arXiv (Cornell University)|May 11, 2007
Speech and Audio Processing参考文献 12被引用 6
一句话总结

该论文提出了一种基于子带的HMM说话人识别系统,通过独立处理各频带并采用线性或非线性技术融合结果,增强了在噪声环境下的鲁棒性。采用线性合并与HMM结合的方法,在实际测试中相比宽带系统将准确率提升了9.78%,在真实环境下展现出显著的性能提升。

ABSTRACT

Speaker identification is a powerful, non-invasive and in-expensive biometric technique. The recognition accuracy, however, deteriorates when noise levels affect a specific band of frequency. In this paper, we present a sub-band based speaker identification that intends to improve the live testing performance. Each frequency sub-band is processed and classified independently. We also compare the linear and non-linear merging techniques for the sub-bands recognizer. Support vector machines and Gaussian Mixture models are the non-linear merging techniques that are investigated. Results showed that the sub-band based method used with linear merging techniques enormously improved the performance of the speaker identification over the performance of wide-band recognizers when tested live. A live testing improvement of 9.78% was achieved

研究动机与目标

  • 在劣化语音条件下,特别是噪声环境中,提升说话人识别性能。
  • 解决噪声影响特定频带导致识别准确率下降的问题。
  • 研究子带处理在提升说话人识别鲁棒性方面的有效性。
  • 比较线性与非线性合并技术(特别是SVM和GMM)在融合子带分类结果方面的性能。
  • 在真实环境(实际测试)条件下评估系统性能,而不仅限于受控环境。

提出的方法

  • 系统将语音信号划分为多个频带,以分离并处理各个频谱分量。
  • 每个子带使用隐马尔可夫模型(HMM)独立进行说话人建模与分类。
  • 通过线性合并(简单求和)或非线性合并技术(如支持向量机SVM和高斯混合模型GMM)将各子带的分类得分进行融合。
  • 线性合并通过求和方式组合子带得分,而非线性合并则利用SVM和GMM对子带间的联合决策空间进行建模。
  • 最终的说话人决策基于合并技术生成的融合得分做出。
  • 在实际测试条件下评估该方法,以评估其在真实场景中的性能。

实验结果

研究问题

  • RQ1与宽带系统相比,子带处理是否能提升在噪声环境下的说话人识别准确率?
  • RQ2在线性与非线性合并技术之间,哪种在子带说话人识别中的性能更优?
  • RQ3在实际测试场景中,基于SVM和GMM的非线性合并是否能超越线性合并?
  • RQ4子带处理在多大程度上缓解了噪声对特定频带的负面影响?
  • RQ5采用子带处理与线性合并时,实际测试准确率的可测量提升幅度是多少?

主要发现

  • 采用线性合并的子带方法在实际测试中显著优于宽带HMM系统。
  • 在实际测试中,采用子带处理与线性合并可实现9.78%的识别准确率提升。
  • 性能增益在噪声环境中最为显著,传统宽带系统在此类条件下性能明显下降。
  • 尽管研究了非线性合并技术(SVM与GMM),但本研究中其性能未超越线性合并。
  • 结果证实,子带处理通过隔离并减轻特定频带区域的噪声影响,显著增强了系统鲁棒性。
  • 本研究表明,线性合并对于真实场景部署中的子带说话人识别具有高度有效且高效的特点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。