Skip to main content
QUICK REVIEW

[論文レビュー] A fully recurrent feature extraction for single channel speech enhancement

P. V. Muhammed Shifas, Claudio Santelli|arXiv (Cornell University)|Jun 9, 2020
Speech and Audio Processing参考文献 24被引用数 5
ひとこと要約

本論文は、騒音環境下でのロバスト性を向上させるために、音声強調モデルに統合された完全な再帰的特徴抽出モジュール、gruCNNを提案する。畳み込み層内にゲート付き再帰ユニット(GRUs)を埋め込むことで、時間にわたる局所的ノイズ統計を捉えることができ、vanilla CNNと比較して最大1.5 dBのセグメンタルSNR向上と0.4のMOS向上を達成するとともに、パラメータ数を25%削減した。

ABSTRACT

Convolutional neural network (CNN) modules are widely being used to build high-end speech enhancement neural models. However, the feature extraction power of vanilla CNN modules has been limited by the dimensionality constraint of the convolution kernels that are integrated - thereby, they have limitations to adequately model the noise context information at the feature extraction stage. To this end, adding recurrency factor into the feature extracting CNN layers, we introduce a robust context-aware feature extraction strategy for single-channel speech enhancement. As shown, adding recurrency results in capturing the local statistics of noise attributes at the extracted features level and thus, the suggested model is effective in differentiating speech cues even at very noisy conditions. When evaluated against enhancement models using vanilla CNN modules, in unseen noise conditions, the suggested model with recurrency in the feature extraction layers has produced a segmental SNR (SSNR) gain of up to 1.5 dB, an improvement of 0.4 in subjective quality in the Mean Opinion Score scale, while the parameters to be optimized are reduced by 25%.

研究の動機と目的

  • 特徴抽出段階での長期間にわたるノイズ文脈をモデル化できないvanilla CNNの制限を解消すること。
  • 未知の非定常ノイズ条件下でも音声強調性能を向上させること。
  • パフォーマンスを損なわずにモデルの複雑さを低減し、リソースが限られたデバイスへのデプロイを可能にすること。
  • 再帰的時間的再帰を、別個のポストプロセッシングモジュールではなく、特徴抽出段階そのものに直接統合すること。
  • ロバストな音声強調のためのビン別再帰モデリングの有効性を検証すること。

提案手法

  • 畳み込み層内にゲート付き再帰ユニット(GRUs)を埋め込むことで、特徴抽出レベルでの時間的モデリングを可能にする、新しいgruCNNセルを提案する。
  • 各畳み込みカーネルに再帰接続を追加することで、時間変動するノイズ統計を捉えることができる、変更を加えたCNNアーキテクチャを採用する。
  • gruCNNを特徴抽出に、全結合層をスペクトルマッピングに使用するハイブリッドモデル、gruCNN_FC-SEを採用する。
  • スペクトログラムを入力表現として採用し、各周波数ビンを時系列として扱うことで、自己回帰的音声特性を活用する。
  • GRUが標準LSTMと比較して少ないパラメータで長期依存性を学習できることを活用する。
  • 多話者データセットを用いて、さまざまなノイズタイプ(未観測の条件を含む)でエンドツーエンドにモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1畳み込み特徴抽出層に再帰性を直接統合することで、単一チャネル音声強調における未知のノイズタイプに対するロバスト性が向上するか?
  • RQ2標準的な特徴抽出後のRNNと比較して、ビン別再帰モデリングは性能とパラメータ効率の面でどのように差をつけるか?
  • RQ3提案されたgruCNNベースの特徴抽出器は、低SNR条件下での音声の聞き取りやすさと聴取的品質をどの程度向上させるか?
  • RQ4従来のRNN-CNNハイブリッドモデルと比較して、パラメータ数を削減しつつも優れたパフォーマンスを達成できるか?
  • RQ5再帰構造により、非定常ノイズと音声成分の分離がより良好に行えるか?

主な発見

  • gruCNN_FC-SEモデルは、未観測のノイズ条件下で、vanilla CNNベースのモデルと比較して最大1.5 dBのセグメンタルSNR(SSNR)向上を達成した。
  • 主観的平均意見スコア(MOS)は0.4ポイント向上し、3.16に達した。これは顕著な聴取的品質向上を示している。
  • CNN_LSTM-SEベースラインと比較して、パラメータ数を25%削減した。27.22Mパラメータ(gruCNN)対36.10Mパラメータ(CNN_LSTM-SE)。
  • すべてのノイズタイプで一貫した性能向上が確認され、特に非定常性の高い通りの騒音や定常的建設騒音に対しても有効であった。
  • すべてのSNRレベルで、PESQ、STOI、COVL、SSNRというすべての目的指標において、gruCNNはCNN_FC-SEおよびCNN_LSTM-SEを上回った。
  • 局所的で低周波数のノイズ(例:通りの騒音)に対して、音声とノイズの分離能力が優れており、これはビン別再帰による局所的統計モデリングに起因するとされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。