Skip to main content
QUICK REVIEW

[論文レビュー] Classification of Speech with and without Face Mask using Acoustic Features

Rohan Kumar Das, Haizhou Li|arXiv (Cornell University)|Oct 8, 2020
Speech Recognition and Synthesis参考文献 38被引用数 5
ひとこと要約

本論文は、音声特徴として線形周波数ケプストラル係数(LFCC)、瞬時周波数コサイン係数(IFCC)、定数-Qケプストラル係数(CQCC)を用い、ComParE 2020のベースラインとスコアレベル融合により、マスクあり・なしの音声分類を新たな手法で提案する。この手法はテストセットで73.50%の未加重平均再現率(UAR)を達成し、チャレンジのベンチマークを1.70%上回った。

ABSTRACT

The understanding and interpretation of speech can be affected by various external factors. The use of face masks is one such factors that can create obstruction to speech while communicating. This may lead to degradation of speech processing and affect humans perceptually. Knowing whether a speaker wears a mask may be useful for modeling speech for different applications. With this motivation, finding whether a speaker wears face mask from a given speech is included as a task in Computational Paralinguistics Evaluation (ComParE) 2020. We study novel acoustic features based on linear filterbanks, instantaneous phase and long-term information that can capture the artifacts for classification of speech with and without face mask. These acoustic features are used along with the state-of-the-art baselines of ComParE functionals, bag-of-audio-words, DeepSpectrum and auDeep features for ComParE 2020. The studies reveal the effectiveness of acoustic features, and their score level fusion with the ComParE 2020 baselines leads to an unweighted average recall of 73.50% on the test set.

研究の動機と目的

  • ComParE 2020で導入された、音声から話者がマスクを着用しているかを同定する課題に対処すること。
  • マスクに起因する音声歪みを捉えるために、新規の音声特徴(LFCC、IFCC、CQCC)の有効性を検証すること。
  • 既存のComParE 2020ベースラインシステムと音声特徴をスコアレベルで統合することで分類性能を向上させること。
  • 線形フィルタバンク、位相情報、および長期的スペクトルダイナミクスがマスク検出に与える影響を評価すること。

提案手法

  • 線形フィルタバンクを用いたLFCC、瞬時の位相を捉えるIFCC、長期的定数-Q変換(CQT)から導出されるCQCCの3つの新規音声特徴を抽出した。
  • ベースラインとしてMFCCと比較し、4つのComParE 2020ベースラインシステム(ComParE機能特徴、音声語の袋(BoAW)、DeepSpectrum、auDeep)と統合した。
  • 開発セットで最適なテストセット汎化性能を達成するように、BOSARISツールキットを用いてロジスティック回帰によるスコアレベル融合を実施した。
  • 各ベースラインシステムのハイパーパrameterを最適化し、調整により最良の性能を示す設定を選定し、開発セットおよびテストセットの両方で結果を報告した。
  • スペクトログラムとピクノグラムを用いて、マスクあり・なし音声におけるスペクトル的および時間的エネルギー動態の可視化分析を実施した。
  • 未加重平均再現率(UAR)を用いて性能を評価した。これは、クラスバランスを考慮した性能評価のため、ComParE 2020の主要指標である。

実験結果

リサーチクエスチョン

  • RQ1線形フィルタバンクに基づく特徴(LFCC)は、マスクに起因するスペクトル歪みを分類に有効に捉えられるか?
  • RQ2スペクトルエネルギーおよびエンVELOP特徴と比較して、瞬時の位相情報(IFCC)はマスク付き音声検出にどの程度寄与するか?
  • RQ3定数-Q変換から得られる長期的スペクトル表現(CQCC)は、短時間特徴と比較してマスク検出性能をどのように向上させるか?
  • RQ4補完的音声特徴とComParE 2020ベースラインのスコアレベル融合は、個々のシステムや多数決投票よりも分類性能を顕著に向上させるか?
  • RQ5異なる音声特徴(LFCC、IFCC、CQCC、MFCC)がマスク付き音声分類の最終的検出精度に果たす相対的寄与度は何か?

主な発見

  • LFCCは音声特徴の中で最高の個別性能を示し、テストセットで68.80%のUARを達成し、MFCCおよびCQCCを上回った。
  • CQCCは開発セットで63.90%、テストセットで70.60%のUARを示し、長期的スペクトル情報の価値を示した。
  • IFCCは開発セットで60.31%のUARにとどまり、マスクによって引き起こされる位相変動がこのタスクにおいて十分に識別不能であることが示された。
  • 4つの音声特徴と4つのComParE 2020ベースラインのスコアレベル融合により、テストセットで73.50%のUARを達成し、ベンチマークの多数決ベースライン(71.80%)を上回った。
  • スコアレベル融合戦略により、多数決より性能が向上し、単純な一致よりも重み付き融合の利点が裏付けられた。
  • 音声特徴とComParE 2020ベースラインの統合により、UARが1.70%向上した。これは、音声特徴と機能的特徴の補完的性質を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。