Skip to main content
QUICK REVIEW

[论文解读] Improving Performance of Speaker Identification System Using Complementary Information Fusion

Md Sahidullah, Sandipan Chakroborty|arXiv (Cornell University)|May 13, 2011
Speech Recognition and Synthesis参考文献 2被引用 3
一句话总结

本文提出了一种新颖的说话人识别系统,通过融合基于声道的特征(LPCC)与基于声带的特征(来自线性预测分析残差信号的特征),利用高阶统计矩对残差信号中的非线性特性进行建模,并将所得决策得分与频谱特征融合,从而在两个公开数据库上实现了优于单一特征方法的性能表现。

ABSTRACT

Feature extraction plays an important role as a front-end processing block in speaker identification (SI) process. Most of the SI systems utilize like Mel-Frequency Cepstral Coefficients (MFCC), Perceptual Linear Prediction (PLP), Linear Predictive Cepstral Coefficients (LPCC), as a feature for representing speech signal. Their derivations are based on short term processing of speech signal and they try to capture the vocal tract information ignoring the contribution from the vocal cord. Vocal cord cues are equally important in SI context, as the information like pitch frequency, phase in the residual signal, etc could convey important speaker specific attributes and are complementary to the information contained in spectral feature sets. In this paper we propose a novel feature set extracted from the residual signal of LP modeling. Higher-order statistical moments are used here to find the nonlinear relationship in residual signal. To get the advantages of complementarity vocal cord based decision score is fused with the vocal tract based score. The experimental results on two public databases show that fused mode system outperforms single spectral features.

研究动机与目标

  • 为解决传统说话人识别系统仅依赖MFCC和LPCC等频谱特征而忽略声带贡献的局限性。
  • 探究声带线索(如基频和残差信号相位)在提升说话人区分能力中的互补作用。
  • 基于LP残差信号的高阶统计矩,开发一种新型特征集,以捕捉非线性动态特性。
  • 研究基于声道的与基于声带的决策得分之间的得分级融合,以提升系统性能。
  • 在标准化的公开数据库上验证所提出的融合框架,以实现稳健的评估。

提出的方法

  • 从线性预测(LP)建模中提取残差信号,以分离与声带相关的激励分量。
  • 计算LP残差信号的高阶统计矩(如偏度、峰度),以建模非线性关系并捕捉说话人特异的声带特征。
  • 将所提取的高阶矩特征用作声带信息的表示,用于说话人识别。
  • 采用标准频谱特征(如LPCC)作为声道基特征集,用于对比与融合。
  • 在得分级层面融合基于声道的系统与基于声带的系统的决策得分,以利用互补信息。
  • 应用加权平均或类似融合策略,将两路得分流合并,实现最终的说话人分类。

实验结果

研究问题

  • RQ1从LP残差信号中提取的特征能否提供传统频谱特征未捕捉到的互补说话人特异性信息?
  • RQ2高阶统计矩在建模残差信号非线性动态特性方面,对说话人识别的有效性如何?
  • RQ3基于声道与声带系统的得分级融合是否能提升整体说话人识别准确率?
  • RQ4所提出的融合系统在基准数据库上的性能与单独的频谱或残差基系统相比如何?
  • RQ5所提出的特征集在不同说话人识别场景与数据库中是否具备鲁棒性?

主要发现

  • 所提出的基于声带的特征集,源自LP残差信号的高阶矩,捕捉到了传统频谱特征中未包含的说话人特异性信息。
  • 基于声道(LPCC)与基于声带的特征的得分级融合,相比单独使用任一特征集,均能提升说话人识别性能。
  • 在两个公开的说话人识别数据库上,融合系统优于单一特征系统,证明了互补信息融合的有效性。
  • 通过高阶矩引入的非线性动态特性,增强了残差信号在说话人识别中的判别能力。
  • 实验结果证实,如基频和残差信号特性等声带线索,为说话人识别提供了有价值的互补信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。