Skip to main content
QUICK REVIEW

[论文解读] An Interesting Property of LPCs for Sonorant Vs Fricative Discrimination

T. Ananthapadmanabha, A. G. Ramakrishnan|arXiv (Cornell University)|Nov 5, 2014
Speech and Audio Processing参考文献 24被引用 5
一句话总结

本文提出了一种音素区分指数——响音-擦音区分指数(SFDI),定义为线性预测系数(LPCs)之和的反正切函数,用于在语音信号中区分响音与擦音。在TIMIT和NTIMIT数据库上采用阈值分类方法,SFDI在干净语音上的准确率达到99.07%,且在0 dB信噪比下仍保持鲁棒性,优于或匹配该二分类任务的最先进方法。

ABSTRACT

Linear prediction (LP) technique estimates an optimum all-pole filter of a given order for a frame of speech signal. The coefficients of the all-pole filter, 1/A(z) are referred to as LP coefficients (LPCs). The gain of the inverse of the all-pole filter, A(z) at z = 1, i.e, at frequency = 0, A(1) corresponds to the sum of LPCs, which has the property of being lower (higher) than a threshold for the sonorants (fricatives). When the inverse-tan of A(1), denoted as T(1), is used a feature and tested on the sonorant and fricative frames of the entire TIMIT database, an accuracy of 99.07% is obtained. Hence, we refer to T(1) as sonorant-fricative discrimination index (SFDI). This property has also been tested for its robustness for additive white noise and on the telephone quality speech of the NTIMIT database. These results are comparable to, or in some respects, better than the state-of-the-art methods proposed for a similar task. Such a property may be used for segmenting a speech signal or for non-uniform frame-rate analysis.

研究动机与目标

  • 提出一种简单而有效的声学特征,用于在连续语音中区分响音与擦音。
  • 评估线性预测系数之和(A(1))作为标量特征在语音音素类别分离中的判别能力。
  • 测试该特征在加性白噪声和电话质量语音等退化条件下的鲁棒性。
  • 探索SFDI在语音信号分割与非均匀帧率分析中的潜力。

提出的方法

  • 使用自相关法在预加重、去均值、汉宁窗加权的20 ms语音帧(5 ms帧移)上计算线性预测系数(LPCs)。
  • 计算A(1),即全极点逆滤波器在z=1处的增益,其值等于LPC系数之和:A(1) = 1 + a₁ + a₂ + ... + aₘ。
  • 将响音-擦音区分指数(SFDI)定义为T(1) = arctan(A(1)),该标量特征对频谱倾斜敏感。
  • 对SFDI施加阈值,将帧分类为响音(低SFDI)或擦音(高SFDI)。
  • 采用基于能量的静音抑制方法,通过将低能量帧的SFDI设为零,以优化分割结果。
  • 在不同信噪比条件(0至20 dB)下,于完整TIMIT和NTIMIT数据库上验证性能。

实验结果

研究问题

  • RQ1线性预测系数之和(A(1))能否作为可靠标量特征,用于区分语音信号中的响音与擦音?
  • RQ2SFDI特征在加性白噪声和电话质量语音带宽受限条件下的退化情况下是否具有鲁棒性?
  • RQ3基于SFDI的分类方法在响音-擦音或V/U分类任务中是否优于现有最先进方法?
  • RQ4SFDI能否有效用于粗粒度语音分割为语音音素类别?
  • RQ5支撑所观察到的区分特性的频谱包络与LPC系数之和之间的关系是什么?

主要发现

  • 在完整TIMIT数据库上使用干净语音时,SFDI实现了99.07%的帧级分类准确率,显著优于大多数先前方法。
  • 在0 dB信噪比下,SFDI在TIMIT上的准确率为91.3%,在NTIMIT上为80.4%,表现出对噪声的强鲁棒性。
  • SFDI分类的阈值在开发集与完整数据库之间保持一致,表明其具有稳定的泛化能力。
  • 基于SFDI的分割结果与人工标注的语音音素边界高度吻合,尤其在擦音与响音过渡区域表现优异。
  • SFDI的性能与使用复杂特征集(如MFCC、导数、SVM)的最先进方法相当或更优。
  • 本研究揭示,LPC系数之和(A(1))能够捕捉响音与擦音之间固有的频谱倾斜差异,从而以极低计算量实现高精度区分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。