Skip to main content
QUICK REVIEW

[論文レビュー] Two Heads Are Better Than One: A Two-Stage Approach for Monaural Noise Reduction in the Complex Domain

Andong Li, Chengshi Zheng|arXiv (Cornell University)|Nov 3, 2020
Speech and Audio Processing参考文献 26被引用数 10
ひとこと要約

本論文は、周波数領域の音声強調におけるマグニチュードと位相推定を分離することで、モノラルノイズ低減を向上させる2段階の複素数ドメイン音声強調ネットワーク(CTS-Net)を提案する。まず、修正されたゲート付き時系列畳み込みモジュール(MG-TCM)を用いて粗いマグニチュード推定値を生成し、ノイズのついた位相と組み合わせて粗い複素スペクトルを形成する。次に、2段階目のネットワークが実部および虚部の残差を学習することで、両方の成分を精緻化し、特に低SNR条件下でPESQ、ESTOI、SDRが従来手法を大きく上回る。

ABSTRACT

In low signal-to-noise ratio conditions, it is difficult to effectively recover the magnitude and phase information simultaneously. To address this problem, this paper proposes a two-stage algorithm to decouple the joint optimization problem w.r.t. magnitude and phase into two sub-tasks. In the first stage, only magnitude is optimized, which incorporates noisy phase to obtain a coarse complex clean speech spectrum estimation. In the second stage, both the magnitude and phase components are refined. The experiments are conducted on the WSJ0-SI84 corpus, and the results show that the proposed approach significantly outperforms previous baselines in terms of PESQ, ESTOI, and SDR.

研究の動機と目的

  • 低SNRにおけるモノラル音声強調におけるマグニチュードと位相の同時推定の課題に対処すること。
  • マグニチュードと位相の複雑な最適化問題を、2つの段階的で管理しやすい部分問題に分離すること。
  • 2段階目の段階でスペクトルのマグニチュードと位相の両方を精緻化することで、主観的品質と話者の理解度を向上させること。
  • 修正されたゲート付き時系列畳み込みモジュール(MG-TCM)を用いて、パラメータの重複を低減し、系列モデリング能力を向上させること。
  • 時間周波数ドメインにおける深層学習ベースの音声強調手法と比較して、一貫した性能向上を示すこと。

提案手法

  • 2段階アーキテクチャを採用:1段階目は純粋に綺麗なマグニチュードを推定する(CME-Net)、2段階目は完全な複素スペクトルを精緻化する(CSR-Net)。
  • 1段階目では、推定されたマグニチュードとノイズのついた位相を組み合わせて、粗い複素スペクトル推定値を生成する。
  • 2段階目では、CSR-Netが粗い推定値と綺麗な複素スペクトルの間の残差を学習し、実部および虚部の両方を最適化する。
  • 標準的なTCMと比較して、パラメータの重複を低減し、長距離時系列モデリングを向上させる修正ゲート付き時系列畳み込みモジュール(MG-TCM)を導入する。
  • 感受 field を拡大するがパラメータ数を増やさないために、拡張型因果畳み込み(SD-conv)を採用し、文脈モデリングを強化する。
  • 実部・虚部に対するL1損失とマグニチュード損失の組み合わせを用いて、エンド・トゥ・エンド最適化でネットワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1マグニチュードと位相推定を2段階に分離することで、低SNRにおけるモノラル音声強調の性能向上が達成できるか?
  • RQ2まずマグニチュードを推定し、その後に複素スペクトルを精緻化する2段階アプローチが、同時最適化と比較してより優れた主観的品質と理解度をもたらすか?
  • RQ3修正ゲート付き時系列畳み込みモジュール(MG-TCM)が、パラメータの重複を低減しつつ、系列モデリング能力を標準TCMを上回るか?
  • RQ42段階目の複素スペクトルにおける残差学習が、PESQ、ESTOI、SDRの指標に顕著な向上をもたらすか?
  • RQ5提案手法の2段階アーキテクチャは、最先端のベースラインと比較して、目的指標およびモデル効率の点で優位性を示すか?

主な発見

  • 提案されたCTS-Netは、WSJ0-SI84テストセットでPESQ 2.71、ESTOI 72.27%、SDR 10.24 dBを達成し、すべてのベースラインを顕著に上回った。
  • 1段階目のMG-TCMバージョンは、元のTCMと比較してPESQを0.04向上、ESTOIを0.50%向上させ、パラメータの重複が低減され、性能が向上していることを示した。
  • 2段階目のMG-TCMをその二重ブランチ版(DMG-TCM)に置き換えると、PESQが0.01、ESTOIが0.38%向上し、より高いモデリング能力を確認した。
  • 拡張型因果畳み込み(SD-conv)を用いることで、標準的な拡張畳み込みと比較してPESQが0.03向上、ESTOIが0.52%向上、SDRが0.13 dB向上した。
  • CME-Net単体と比較して、CTS-NetはPESQで0.25、ESTOIで6.94%の向上を示し、2段階目の精緻化段階の必要性を裏付けた。
  • GCRNと比較すると、CTS-NetはPESQが0.18高く、ESTOIが4.29%高く、SDRが1.38 dB高い結果を示し、指標全体にわたり一貫した優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。