Skip to main content
QUICK REVIEW

[論文レビュー] Speech Enhancement In Multiple-Noise Conditions using Deep Neural Networks

Anurag Kumar, Dinei Florêncio|arXiv (Cornell University)|May 9, 2016
Speech and Audio Processing被引用数 6
ひとこと要約

本稿では、複数の同時発生する定常的でない騒音(オフィス環境の雰囲気音、プリンターやタイプライターの音など)を伴う現実世界のオフィス環境を想定し、走査的ノイズ推定と心理音響的重み付け学習を用いた深層ニューラルネットワーク(DNN)ベースの音声強調手法を提案する。最良のモデルは、全SNR範囲でノイズ混在音声比して平均23.97%のPESQ向上を達成し、複雑なマルチノイズ環境下で従来のLog-MMSE法を著しく上回る性能を示した。

ABSTRACT

In this paper we consider the problem of speech enhancement in real-world like conditions where multiple noises can simultaneously corrupt speech. Most of the current literature on speech enhancement focus primarily on presence of single noise in corrupted speech which is far from real-world environments. Specifically, we deal with improving speech quality in office environment where multiple stationary as well as non-stationary noises can be simultaneously present in speech. We propose several strategies based on Deep Neural Networks (DNN) for speech enhancement in these scenarios. We also investigate a DNN training strategy based on psychoacoustic models from speech coding for enhancement of noisy speech

研究の動機と目的

  • 複数の定常的および非定常的ノイズが同時に発生する現実世界のオフィス環境における音声強調を解決すること。
  • 単一ノイズまたは一致するノイズ条件にとどまらないDNNベースの音声強調のロバスト性を向上させることを目的とし、複雑なマルチソースノイズ歪みをモデル化すること。
  • 静的ノイズ情報ではなく、動的ノイズ推定値を用いたノイズ認識型学習の有効性を検証すること。
  • 最適化中に音声品質にとってより重要な周波数帯域を優先するために、心理音響的原則を用いてDNN損失関数に重みを付けること。
  • 訓練中に存在しなかった未観測の不一致ノイズ条件や非常に非定常的ノイズ条件下での一般化性能と性能向上を実証すること。

提案手法

  • オフィスの雰囲気音、プリンターやタイプライターの音を含む多様なノイズタイプを含む100時間分のデータでトレーニングされたDNNアーキテクチャを提案し、複雑なマルチノイズ環境をモデル化すること。
  • フレームごとの走査的ノイズ推定値を入力特徴量として導入し、特に低SNR条件下での非定常ノイズへの対応を向上させた。
  • 音声認識分野のインスピレーションを受けて、動的ノイズ推定値を用いたノイズ認識型学習戦略を採用し、ロバスト性を強化した。
  • 心理音響的原則を応用し、DNN損失関数に重み付けを施し、音声品質に寄与する周波数帯域を最適化プロセスで優先することを実現した。
  • 入力としてメル周波数ケプストラム特徴量を用い、エンドツーエンドDNN学習によりクリア音声のスペクトルマグニチュードを予測することを実装した。
  • 複数のDNNバリアント(BD, BSD, BED, BEWD)を評価し、BEWDはノイズ認識型学習と重み付け学習の両方を統合した。

実験結果

リサーチクエスチョン

  • RQ1DNNベースの音声強調は、現実世界のオフィス環境に一般的に見られる複数の同時発生ノイズ(定常的および非定常的)を効果的に処理できるか?
  • RQ2フレームごとの走査的ノイズ推定値を入力特徴量として用いることで、静的ノイズ情報に比べ、非定常ノイズ条件下でのDNN性能が向上するか?
  • RQ3心理音響的重み付けDNN学習は、低SNR、マルチノイズ環境下で音声品質および話者の理解度をどの程度向上させるか?
  • RQ4訓練時に存在しなかったまたは不一致するノイズ条件下でのモデルの一般化性能はいかがなっているか?
  • RQ5多様なノイズデータでトレーニングされたDNNは、特に低SNR条件下でも一貫して高い性能を発揮できるか?

主な発見

  • 最良のDNNモデル(BEWD)は、全SNR範囲でノイズ混在音声比して平均23.97%のPESQ向上を達成し、-5 dB SNRでは30%を超える向上を示した。
  • -5 dB SNR条件下で、BED DNNはノイズ混在音声比してSTOIで15–16%の向上を示し、Log-MMSEを著しく上回った。
  • 走査的ノイズ推定値を入力特徴量として用いることで、特に低SNR条件下で顕著な性能向上が得られ、非定常ノイズの追跡精度が向上した。
  • 心理音響的重み付け学習は特定のテストケースで測定可能な向上を示したが、平均的な向上は極めて低SNR条件下で顕著であった。
  • 大容量のトレーニングデータ(100時間)は、小容量データ(25時間)よりも一貫して優れた性能を示し、全SNRレベルでPESQおよびSTOIの両方で向上した。
  • スペクトログラムおよび主観的評価結果から、BEWDはLog-MMSEに比べ、より明瞭で理解しやすい音声を生成していることが確認された。Log-MMSEは高レベルの非定常ノイズ条件下で失敗していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。