Skip to main content
QUICK REVIEW

[论文解读] A Multi Level Data Fusion Approach for Speaker Identification on Telephone Speech

Imen Trabelsi, Dorra Ben Ayed Mezghanni|arXiv (Cornell University)|Jun 27, 2014
Speech and Audio Processing参考文献 17被引用 5
一句话总结

本文提出了一种多层级数据融合方法,用于在降质电话语音中进行与文本无关的说话人识别,采用互补特征(MFCC 和 RASTA-PLP)并使用 GMM 建模,通过 SVM 和朴素贝叶斯分类器进行融合。多特征集与学习模型的融合显著提升了在嘈杂 NTIMIT 数据库上的性能,证明了对语音降质的鲁棒性。

ABSTRACT

Several speaker identification systems are giving good performance with clean speech but are affected by the degradations introduced by noisy audio conditions. To deal with this problem, we investigate the use of complementary information at different levels for computing a combined match score for the unknown speaker. In this work, we observe the effect of two supervised machine learning approaches including support vectors machines (SVM) and naïve bayes (NB). We define two feature vector sets based on mel frequency cepstral coefficients (MFCC) and relative spectral perceptual linear predictive coefficients (RASTA-PLP). Each feature is modeled using the Gaussian Mixture Model (GMM). Several ways of combining these information sources give significant improvements in a text-independent speaker identification task using a very large telephone degraded NTIMIT database.

研究动机与目标

  • 解决在嘈杂、真实世界电话语音环境中说话人识别性能下降的问题。
  • 探索结合多种特征集(MFCC 和 RASTA-PLP)以提升鲁棒性的有效性。
  • 评估在多个层级——特征级、得分级和分类器级——采用不同融合策略对系统准确率的影响。
  • 研究监督学习模型(SVM 和朴素贝叶斯)在整合互补特征证据中的作用。
  • 在大规模、降质电话语音数据库(NTIMIT)上,展示在与文本无关的说话人识别中性能的显著提升。

提出的方法

  • 作者提取了两组不同的特征:梅尔频率倒谱系数(MFCC)和相对谱感知线性预测系数(RASTA-PLP)。
  • 每组特征独立使用高斯混合模型(GMM)进行建模,以生成与说话人相关的似然得分。
  • 通过支持向量机(SVM)和朴素贝叶斯分类器,在多个层级上融合来自两组特征的匹配得分:特征级融合、得分级融合和分类器级融合。
  • 融合策略整合了不同特征表示的互补信息,以在降质条件下增强判别能力。
  • 系统在大规模、嘈杂的 NTIMIT 数据库上进行训练和评估,以模拟真实电话语音环境。
  • 使用标准的说话人识别指标评估性能,特别关注对声学降质的鲁棒性。

实验结果

研究问题

  • RQ1结合 MFCC 和 RASTA-PLP 特征在降质电话语音中如何提升说话人识别性能?
  • RQ2在融合多层级特征时,SVM 和朴素贝叶斯分类器的相对贡献是什么?
  • RQ3多层级融合(特征级、得分级和分类器级)在多大程度上优于单层级或单特征方法?
  • RQ4不同融合策略如何影响系统在嘈杂、真实世界电话环境中的鲁棒性?
  • RQ5互补的特征表示能否缓解说话人识别系统中因语音降质导致的性能下降?

主要发现

  • MFCC 和 RASTA-PLP 特征的融合显著提升了说话人识别的准确率,相较于单独使用任一特征集均有明显改善。
  • 在得分级和分类器级采用基于 GMM 的建模与 SVM 及朴素贝叶斯分类器的结合,使 NTIMIT 数据库上的性能获得显著提升。
  • 多层级融合策略——尤其是得分级融合——实现了最高性能,证明了在多个处理阶段整合证据的有效性。
  • 所提出的方法对降质具有鲁棒性,在嘈杂电话语音条件下仍能保持高准确率。
  • 结果证实,来自多样化特征集的互补信息可增强与文本无关说话人识别任务中的系统可靠性与判别能力。
  • 本研究验证了监督学习模型(SVM 和朴素贝叶斯)在融合多源信息以提升说话人识别性能方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。