Skip to main content
QUICK REVIEW

[論文レビュー] spatial-dccrn: dccrn equipped with frame-level angle feature and hybrid filtering for multi-channel speech enhancement

Shubo Lv, Yihui Fu|arXiv (Cornell University)|Oct 17, 2022
Speech and Audio Processing被引用数 9
ひとこと要約

本論文では、フレームレベルの角度特徴量とマスクング・マッピングフィルタリング(MMF)戦略を統合することで、空間情報の活用と残存ノイズの抑制を向上させる、マルチチャネル音声強調モデルであるSpatial-DCCRNを提案する。S-DCCRNアーキテクチャをマルチチャネル処理に拡張し、明示的な空間モデリングのための角度特徴抽出(AFE)モジュールを適用し、従来のフィルタ・アンド・サム処理に代えて段階的なMMFを採用することで、L3DAS22およびConferencingSpeech2021チャレンジの両方で最先端の性能を達成し、MIMO-Unet や EaBNet などのモデルを上回った。

ABSTRACT

Recently, multi-channel speech enhancement has drawn much interest due to the use of spatial information to distinguish target speech from interfering signal. To make full use of spatial information and neural network based masking estimation, we propose a multi-channel denoising neural network -- Spatial DCCRN. Firstly, we extend S-DCCRN to multi-channel scenario, aiming at performing cascaded sub-channel and full-channel processing strategy, which can model different channels separately. Moreover, instead of only adopting multi-channel spectrum or concatenating first-channel's magnitude and IPD as the model's inputs, we apply an angle feature extraction module (AFE) to extract frame-level angle feature embeddings, which can help the model to apparently perceive spatial information. Finally, since the phenomenon of residual noise will be more serious when the noise and speech exist in the same time frequency (TF) bin, we particularly design a masking and mapping filtering method to substitute the traditional filter-and-sum operation, with the purpose of cascading coarsely denoising, dereverberation and residual noise suppression. The proposed model, Spatial-DCCRN, has surpassed EaBNet, FasNet as well as several competitive models on the L3DAS22 Challenge dataset. Not only the 3D scenario, Spatial-DCCRN outperforms state-of-the-art (SOTA) model MIMO-UNet by a large margin in multiple evaluation metrics on the multi-channel ConferencingSpeech2021 Challenge dataset. Ablation studies also demonstrate the effectiveness of different contributions.

研究の動機と目的

  • 既存のマルチチャネル音声強調モデルが空間情報を暗黙的に学習するか、最適でないフィルタ・アンド・サム操作に依存するという限界を解消すること。
  • 音声とノイズが同じ時間周波数ビンに重複するような困難な状況において、特に残存ノイズを低減することにより性能を向上させること。
  • チャネル間位相差(IPD)から抽出したフレームレベルの角度特徴量を用いて、空間情報を明示的にモデリングすること。
  • 粗いノイズ除去、エコー除去、残存ノイズ抑制を段階的に統合する新しいフィルタリング戦略を開発すること。
  • L3DAS22およびConferencingSpeech2021を含むベンチマークデータセットにおいて、最先端のモデルと比較して優れた性能を示すこと。

提案手法

  • S-DCCRNの段階的サブチャネルおよびフルチャネル処理戦略をマルチチャネル状況に拡張し、局所的およびグローバルなチャネル情報の別々のモデリングを可能にする。
  • cosIPD特徴量を畳み込み層とドレインブロックを用いて処理する角度特徴抽出(AFE)モジュールを導入し、フレームレベルの空間埋め込みを生成する。
  • 標準的なフィルタ・アンド・サム処理に代えて、マスクングとマッピングフィルタリング(MMF)機構を導入する。ここで、マスク処理がエコー除去と粗いノイズ除去を担当し、マッピングが残存ノイズを除去する。
  • スタックされたノイズ混在スペクトルとマッピングフィルタから、3次元畳み込みブロックを用いてマスクフィルタを推定することで、スペクトル成分と位相成分の共同最適化を実現する。
  • 音声の自然さと耐性を向上させるために、STOI、WER(Wav2Vec2.0を介して)、およびPHASEN損失を組み合わせたハイブリッド損失関数を採用する。
  • 基本モデルでは因果推論を適用し、最適な性能を達成するために非因果バージョンも評価する。アブレーションスタディにより、各モジュールの寄与度が検証されている。
Fig. 1 : Network structure of the proposed Spatial-DCCRN. ”LSC” denotes learnable spectrum compression, ”AFE” denotes angle feature extraction, ”CFE” denotes complex feature encoder, ”CFD” denotes complex feature decoder, ”MMF” denotes masking and mapping filtering and ”CAT” denotes concatenate.
Fig. 1 : Network structure of the proposed Spatial-DCCRN. ”LSC” denotes learnable spectrum compression, ”AFE” denotes angle feature extraction, ”CFE” denotes complex feature encoder, ”CFD” denotes complex feature decoder, ”MMF” denotes masking and mapping filtering and ”CAT” denotes concatenate.

実験結果

リサーチクエスチョン

  • RQ1チャネル間位相差(IPD)から導出される明示的なフレームレベルの角度特徴量は、マルチチャネル音声強調性能を向上させることができるか?
  • RQ2段階的なマスクング・マッピングフィルタリング戦略は、従来のフィルタ・アンド・サム処理に比べて、残存ノイズ低減とエコー除去の両面で優れているか?
  • RQ3サブチャネルとフルチャネル処理の統合は、マルチチャネルDNNにおける空間的およびスペクトル的モデリングをどのように向上させるか?
  • RQ4角度特徴量とMMFモジュールは、実世界のマルチチャネル音声強調ベンチマークにおける性能向上にどの程度寄与しているか?
  • RQ5明示的な空間特徴量学習とマルチステージフィルタリングを統合したモデルは、L3DAS22およびConferencingSpeech2021チャレンジの両方で最先端の結果を達成できるか?

主な発見

  • Spatial-DCCRNはL3DAS22チャレンジデータセットで0.956のスコアを達成し、MIMO-Unet や EaBNet を含む最先端モデルを上回った。
  • ConferencingSpeech2021チャレンジの開発セットにおいて、Spatial-DCCRNはすべての指標でMIMO-Unetを上回った。ベースライン比で統合指標が0.057向上し、ベースモデル比で0.016向上した(AFEとMMFを両方使用した場合)。
  • AFEモジュールはスコアに0.011の寄与を示し、MMFモジュールは0.007の寄与を示しており、フィルタリング設計よりも空間特徴量学習の影響が強いことが示された。
  • 非因果バージョンのSpatial-DCCRNが最良の性能を示し、このタスクにおいて非因果モデリングの利点が裏付けられた。
  • PHASENとSI-SNR損失を併用することで、単独で使用する場合よりも優れた結果が得られ、時間領域と周波数領域での共同最適化が耐性を向上させることを示した。
  • 入力チャネル数を4から8に増やすことで性能が顕著に向上し、マルチマイク環境におけるスケーラビリティと耐性の高さが実証された。
Fig. 2 : Network structure of angle feature extraction and sub/full channel DCCRN. ‘GCC‘ denotes group complex convolution, ‘GCTC‘ denotes group complex transpose convolution and ‘CP‘ denotes convolution pathway – a convolution layer among the encoder and decoder [ 17 ] . ”AF” denotes angle feature
Fig. 2 : Network structure of angle feature extraction and sub/full channel DCCRN. ‘GCC‘ denotes group complex convolution, ‘GCTC‘ denotes group complex transpose convolution and ‘CP‘ denotes convolution pathway – a convolution layer among the encoder and decoder [ 17 ] . ”AF” denotes angle feature

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。