Skip to main content
QUICK REVIEW

[論文レビュー] Glance and Gaze: A Collaborative Learning Framework for Single-channel Speech Enhancement

Andong Li, Chengshi Zheng|arXiv (Cornell University)|Jun 22, 2021
Speech and Audio Processing参考文献 45被引用数 14
ひとこと要約

本稿では、複素領域におけるマグニチュードと位相成分を共同最適化する協調学習フレームワークであるGaGNetを提案する。グレースパスによる粗いマグニチュード推定とグーズパスによる詳細なスペクトル修復を組み合わせ、スタックされたグレース・グーズモジュールを介して繰り返しスペクトルを精緻化することで、WSJ0-SI84およびDNS-Challengeデータセットで最先端の性能を達成し、優れた主観的品質と低い計算コストを実現した。

ABSTRACT

The capability of the human to pay attention to both coarse and fine-grained regions has been applied to computer vision tasks. Motivated by that, we propose a collaborative learning framework in the complex domain for monaural noise suppression. The proposed system consists of two principal modules, namely spectral feature extraction module (FEM) and stacked glance-gaze modules (GGMs). In FEM, the UNet-block is introduced after each convolution layer, enabling the feature recalibration from multiple scales. In each GGM, we decompose the multi-target optimization in the complex spectrum into two sub-tasks. Specifically, the glance path aims to suppress the noise in the magnitude domain to obtain a coarse estimation, and meanwhile, the gaze path attempts to compensate for the lost spectral detail in the complex domain. The two paths work collaboratively and facilitate spectral estimation from complementary perspectives. Besides, by repeatedly unfolding the GGMs, the intermediate result can be iteratively refined across stages and lead to the ultimate estimation of the spectrum. The experiments are conducted on the WSJ0-SI84, DNS-Challenge dataset, and Voicebank+Demand dataset. Results show that the proposed approach achieves state-of-the-art performance over previous advanced systems on the WSJ0-SI84 and DNS-Challenge dataset, and meanwhile, competitive performance is achieved on the Voicebank+Demand corpus.

研究の動機と目的

  • ノイズが多く、SNRが低い環境下で、位相とマグニチュードが相互に依存する単一耳音声強調の課題に対処すること。
  • 複素スペクトル領域におけるマグニチュードと位相成分を共同最適化することで、音声品質と聞き取りやすさを向上させること。
  • 逐次的・単一段階のモデルの限界を克服し、階層的精錬を実現する並列的でマルチステージのフレームワークを導入すること。
  • デコンボリューションデコーダーを2次元畳み込みとリーマン学習に置き換えることで、計算コストを低減しながら高い性能を維持すること。
  • DNSMOSを基準として、モデル出力を人間の主観的評価と一致させることで、知覚的品質を向上させること。

提案手法

  • フレームワークは、各畳み込み層の後にUNetスタイルのスキップ接続を適用するスペクトル特徴抽出モジュール(FEM)で構成され、マルチスケール特徴の再キャリブレーションを可能にする。
  • グレース・グーズモジュール(GGM)は、複素スペクトル最適化を2つの並列なサブタスクに分解する:グレースパスはノイズ抑制のためのマグニチュード推定を行い、グーズパスは複素領域で失われたスペクトル詳細を回復する。
  • 各GGMは、リーマン接続を備えた共有エンコーダ・デコーダ構造を用い、スタックされた段階を横断して繰り返し精錬を実現する。
  • グレースパスはマグニチュード領域で動作し、粗いスペクトル推定を生成する。一方、グーズパスは複素領域で位相と振幅の詳細を精錬する。
  • モデルは複素スペクトルにおけるMSE損失を用いてエンドツーエンドで学習され、明示的な位相モデリングは行われず、実部・虚部成分による暗黙の位相推定に依存する。
  • トランスポジット畳み込みを回避するため、ストライド畳み込みと2次元畳み込みのみを用いることで、MAC演算とメモリフットプリントを削減する。

実験結果

リサーチクエスチョン

  • RQ1マグニチュードと位相を複素領域で共同最適化する二重パスの協調学習フレームワークは、音声強調性能を向上させることができるか?
  • RQ2並列的でマルチステージのアーキテクチャは、逐次的または単一段階のモデルと比較して、スペクトル精度と知覚的品質の面で優れているか?
  • RQ3スタックされたグレース・グーズモジュールによる反復的精錬は、低SNR環境下での収束性とロバストネスを向上させるか?
  • RQ4提案手法は、最先端の時間領域および周波数領域ベースラインと比較して、計算効率と性能の面で優れているか?
  • RQ5本手法は、さまざまなSNRレベルやノイズタイプを有する多様なデータセットに、どの程度一般化可能か?

主な発見

  • WSJ0-SI84データセットでは、GaGNetはWB-PESQが2.94を達成し、PHASENやMetricGAN+を含む従来のSOTAシステムを上回った。
  • DNS-Challengeデータセットでは、GaGNetはWB-PESQ(2.94)、STOI(0.87)、SI-SDR(14.8 dB)、PESQ(2.71)の4つの指標すべてで最高スコアを記録し、すべての先行手法を上回った。
  • Voicebank+Demandデータセットでは、CSIGが4.26、COVLが3.59という競争力のある結果を達成し、高入力SNRレベル下でも上位に位置づけられた。
  • すべてのテスト済みシステムの中で最高のDNSMOSスコア(4.28)を記録し、優れた主観的音声品質認識を示した。
  • GaGNetは、同等のモデルと比較して計算コストが低く、1秒間の音声入力に対してパラメータ数が1.2M、1.8 GFLOPsにとどまり、ConvTasNetを凌駆する遅延と効率性を実現した。
  • アブレーションスタディにより、二重パス構造とマルチステージスタッキングが性能向上に顕著に寄与することが確認され、グーズパスが残存ノイズを低減し、スペクトル詳細を回復した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。