Skip to main content
QUICK REVIEW

[論文レビュー] On Cross-Corpus Generalization of Deep Learning Based Speech Enhancement

Ashutosh Pandey, DeLiang Wang|arXiv (Cornell University)|Feb 10, 2020
Speech and Audio Processing参考文献 40被引用数 5
ひとこと要約

この論文は、特に低SNR条件下において、深層学習ベースの音声強調処理における未学習コーパスへの一般化性能の低さの主な要因として、チャネル不一致を特定した。本研究では、2つの主要な解決策を提案する:LibriAllのような多様でクラウドソーシングされたコーパスでの学習、およびより小さなSTFTフレームシフトの採用であり、これらを組み合わせることで、未学習コーパスにおける性能が顕著に向上し、IEEE Maleで-5 dB SNR条件下でSTOIが最大8.1%向上した。

ABSTRACT

In recent years, supervised approaches using deep neural networks (DNNs) have become the mainstream for speech enhancement. It has been established that DNNs generalize well to untrained noises and speakers if trained using a large number of noises and speakers. However, we find that DNNs fail to generalize to new speech corpora in low signal-to-noise ratio (SNR) conditions. In this work, we establish that the lack of generalization is mainly due to the channel mismatch, i.e. different recording conditions between the trained and untrained corpus. Additionally, we observe that traditional channel normalization techniques are not effective in improving cross-corpus generalization. Further, we evaluate publicly available datasets that are promising for generalization. We find one particular corpus to be significantly better than others. Finally, we find that using a smaller frame shift in short-time processing of speech can significantly improve cross-corpus generalization. The proposed techniques to address cross-corpus generalization include channel normalization, better training corpus, and smaller frame shift in short-time Fourier transform (STFT). These techniques together improve the objective intelligibility and quality scores on untrained corpora significantly.

研究の動機と目的

  • 深層学習ベースの音声強調処理モデルが、未学習の音声コーパスに一般化できない理由を、特に低SNR条件下で調査すること。
  • 特に低SNR領域において、未学習コーパスへの一般化性能が著しく低下する主な原因を同定すること。
  • 従来のチャネル正規化技術(例:CMS、RASTA)が、教師あり音声強調処理における未学習コーパスへの一般化性能を向上させる効果を評価すること。
  • 公開利用可能なデータセットが、未学習コーパスへの一般化性能を向上させるためにどの程度適しているかを評価すること。
  • 新たに提案された手法(具体的には、LibriAllコーパスの使用とSTFTフレームシフトの短縮)の有効性を検証し、多様な録音環境への頑健性を向上させること。

提案手法

  • 本研究では、LibriSpeech、VoxCeleb、TIMIT、IEEE などの多様なコーパスで学習された深層ニューラルネットワーク(DNN)モデルを評価し、未学習のコーパスでの一般化性能を検証した。
  • チャネル不一致の影響を軽減するために、対数スペクトル領域におけるケプストラム平均減算(CMS)およびRASTAフィルタリングを適用した。
  • 短時間処理パイプラインにおいて、より小さなSTFTフレームシフト(4 ms)を導入することで、時間分解能を向上させ、モデルの頑健性を向上させた。
  • モデルの一般化性能を向上させるために、損失関数を変更したが、低SNR条件下ではその有効性は限定的であった。
  • 多様な音響環境で収録されたクラウドソーシングによる音声データから構成されるLibriAllコーパスが、優れた学習リソースであると評価された。
  • モデルは、アネクソイックなデータで学習し、実際の部屋のインパulse応答(RIR)を用いて、ノイズ混在・リバーブ混在のデータでテストすることで、頑健性を評価した。

実験結果

リサーチクエスチョン

  • RQ1なぜDNNベースの音声強調処理モデルは、未学習の音声コーパスに一般化できないのか、特に低SNRレベルで顕著に現れるのか?
  • RQ2訓練データとテストデータの間のチャネル不一致が、音声強調処理における一般化ギャップにどの程度寄与しているのか?
  • RQ3従来のチャネル正規化技術(例:CMS、RASTA)は、教師あり音声強調処理における未学習コーパスへの一般化性能を向上させるのにどの程度有効なのか?
  • RQ4どの公開利用可能な音声コーパスが、未学習コーパスへの一般化性能を向上させるために最も効果的であり、その理由は何か?
  • RQ5STFTフレームシフトを短縮することで、未学習コーパスへの一般化性能が向上するのか?また、その効果はコーパス選択に比べてどの程度の性能向上をもたらすのか?

主な発見

  • 未学習コーパスへの一般化性能が著しく低下する主な要因は、訓練データとテストデータの間のチャネル不一致であり、特に低SNR条件下で顕著に現れる。
  • 従来のチャネル正規化技術(CMSおよびRASTA)は、未学習コーパスでの性能を向上させるが、特に低SNR条件下では限定的な向上効果にとどまる。
  • LibriAllコーパスを用いて学習させることで、-5 dB SNR条件下でIEEE MaleではSTOIが8.1%向上し、IEEE Femaleでは5.3%向上し、VoxCelebなど他のコーパスを著しく上回った。
  • STFTフレームシフトを4 msに短縮することで、-5 dB SNR条件下でTIMITではSTOIが3.5%向上、IEEE Maleでは1.8%、IEEE Femaleでは3.5%向上し、顕著な性能向上が確認された。
  • LibriAllコーパスと4 msフレームシフトの組み合わせにより、-5 dB SNR条件下でWSJではSTOIが70.8%、IEEE Femaleでは63.7%に達し、同じコーパスで学習した場合の性能(62.8%および65.3%)に近づいた。
  • ノイズ混在・リバーブ混在の条件下では、LibriAllで学習し、4 msフレームシフトを採用したモデルが最良の性能を示し、IEEE FemaleではSTOIが70.3%、PESQが1.94を記録し、リバーブおよびノイズに対して高い頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。