Skip to main content
QUICK REVIEW

[论文解读] Classification of Speech with and without Face Mask using Acoustic Features

Rohan Kumar Das, Haizhou Li|arXiv (Cornell University)|Oct 8, 2020
Speech Recognition and Synthesis参考文献 38被引用 5
一句话总结

该论文提出了一种新颖的方法,通过线性频率倒谱系数(LFCC)、瞬时频率余弦系数(IFCC)和常Q倒谱系数(CQCC)等声学特征,并与ComParE 2020基线系统通过分数级融合,实现对戴口罩与未戴口罩语音的分类。该方法在测试集上实现了73.50%的未加权平均召回率(UAR),比挑战基准高出1.70个百分点。

ABSTRACT

The understanding and interpretation of speech can be affected by various external factors. The use of face masks is one such factors that can create obstruction to speech while communicating. This may lead to degradation of speech processing and affect humans perceptually. Knowing whether a speaker wears a mask may be useful for modeling speech for different applications. With this motivation, finding whether a speaker wears face mask from a given speech is included as a task in Computational Paralinguistics Evaluation (ComParE) 2020. We study novel acoustic features based on linear filterbanks, instantaneous phase and long-term information that can capture the artifacts for classification of speech with and without face mask. These acoustic features are used along with the state-of-the-art baselines of ComParE functionals, bag-of-audio-words, DeepSpectrum and auDeep features for ComParE 2020. The studies reveal the effectiveness of acoustic features, and their score level fusion with the ComParE 2020 baselines leads to an unweighted average recall of 73.50% on the test set.

研究动机与目标

  • 为解决仅从语音中检测说话人是否佩戴口罩这一挑战,该挑战由ComParE 2020提出。
  • 探究新型声学特征——LFCC、IFCC和CQCC在捕捉口罩引起的语音失真方面的有效性。
  • 通过声学特征与既有的ComParE 2020基线系统进行分数级融合,提升分类性能。
  • 评估线性滤波器组、相位信息以及长期谱动态对口罩检测的影响。

提出的方法

  • 提取了三种新型声学特征:基于线性间隔滤波器组的LFCC、捕捉瞬时相位的IFCC,以及从长期恒Q变换(CQT)中提取的CQCC。
  • 将这些特征与MFCC作为基线进行比较,并与四个ComParE 2020基线系统(ComParE功能特征、音频词袋(BoAW)、DeepSpectrum和auDeep)集成。
  • 使用BOSARIS工具包中的逻辑回归进行分数级融合,在开发集上学习系统权重,以实现对测试集的最佳泛化。
  • 对每个基线系统优化超参数,并通过调优选择最佳性能配置,结果在开发集和测试集上均报告。
  • 使用 spectrograms 和 pyknograms 对戴口罩与未戴口罩语音的谱特性和时间能量动态进行可视化分析。
  • 使用未加权平均召回率(UAR)作为评估指标,该指标是ComParE 2020中衡量类别平衡性能的主要指标。

实验结果

研究问题

  • RQ1基于线性滤波器组的特征(LFCC)能否有效捕捉语音中的口罩引起的谱失真以实现分类?
  • RQ2与谱能量和包络特征相比,瞬时相位信息(IFCC)在检测戴口罩语音方面贡献程度如何?
  • RQ3与短时特征相比,从恒Q变换中提取的长期谱表示(CQCC)在口罩检测性能方面有何提升?
  • RQ4将互补的声学特征与ComParE 2020基线系统进行分数级融合,是否能显著提升分类性能,超过单一系统或多数投票方法?
  • RQ5不同声学特征(LFCC、IFCC、CQCC、MFCC)对戴口罩语音分类最终检测准确率的相对贡献是什么?

主要发现

  • 在所有声学特征中,LFCC表现最佳,其在测试集上的UAR达到68.80%,优于MFCC和CQCC。
  • CQCC表现强劲,开发集上UAR为63.90%,测试集上达到70.60%,表明长期谱信息具有重要价值。
  • IFCC表现较差,开发集上UAR仅为60.31%,表明口罩引起的相位变化对本任务的判别性不足。
  • 四种声学特征与四种ComParE 2020基线系统进行分数级融合后,测试集上的UAR达到73.50%,超过基准多数投票基线(71.80%)。
  • 分数级融合策略优于多数投票,证明了加权融合相比简单共识的优势。
  • 声学特征与ComParE 2020基线系统的融合使UAR提升了1.70%,证实了声学特征与功能特征之间的互补性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。