Skip to main content
QUICK REVIEW

[論文レビュー] Interactive Speech and Noise Modeling for Speech Enhancement

Chengyu Zheng, Xiulian Peng|arXiv (Cornell University)|Dec 17, 2020
Speech and Audio Processing被引用数 4
ひとこと要約

本論文では、音声とノイズの両方を同時にモデル化し、相互に情報交換を行うクロスブランチ相互作用モジュールを備えた二本の分岐を持つ畳み込みニューラルネットワーク、SN-Netを提案する。SN-Netは、残存畳み込み・アテンション(RA)ブロックを統合し、音声とノイズのブランチ間での特徴交換を可能にすることで、Voice Bank + DEMAND や DNS Challenge といった公開ベンチマークにおいて、音声強調および話者分離の両タスクで最先端の性能を達成し、従来手法を大きく上回った。

ABSTRACT

Speech enhancement is challenging because of the diversity of background noise types. Most of the existing methods are focused on modelling the speech rather than the noise. In this paper, we propose a novel idea to model speech and noise simultaneously in a two-branch convolutional neural network, namely SN-Net. In SN-Net, the two branches predict speech and noise, respectively. Instead of information fusion only at the final output layer, interaction modules are introduced at several intermediate feature domains between the two branches to benefit each other. Such an interaction can leverage features learned from one branch to counteract the undesired part and restore the missing component of the other and thus enhance their discrimination capabilities. We also design a feature extraction module, namely residual-convolution-and-attention (RA), to capture the correlations along temporal and frequency dimensions for both the speech and the noises. Evaluations on public datasets show that the interaction module plays a key role in simultaneous modeling and the SN-Net outperforms the state-of-the-art by a large margin on various evaluation metrics. The proposed SN-Net also shows superior performance for speaker separation.

研究の動機と目的

  • 既存の音声強調手法が音声モデリングにのみ焦点を当て、ノイズ特性を無視するという限界を是正すること。
  • ブランチ間の双方向的情報フローを備えた、音声とノイズを同時にモデリングすることで音声強調を向上させること。
  • 相互作用モジュールを通じて音声ブランチとノイズブランチの補完的特徴を活用し、残存ノイズと音声歪みを低減すること。
  • 音声とノイズの両方におけるグローバルな時間的および周波数的依存関係を捉えることのできる、頑健な特徴抽出機構の開発。
  • 提案フレームワークを話者分離に拡張し、単一話者強調を超えた汎用性を実証すること。

提案手法

  • SN-Netは、音声とノイズブランチに共通の構造を持つ二本の分岐型エンコーダ・デコーダアーキテクチャを採用し、両信号の共同モデリングを可能にする。
  • 中間層に複数の相互作用モジュールを挿入することで、音声ブランチとノイズブランチ間での特徴交換を可能にし、識別能と特徴の精錬を向上させる。
  • 残存畳み込み・アテンション(RA)ブロックは、残存接続、深さ方向に分離された畳み込み、および並列な時間的・周波数的自己アテンションを組み合わせ、長距離依存関係をモデル化する。
  • 時間的自己アテンションは時間フレーム全体にわたるグローバルパターンを捉え、周波数的自己アテンションは周波数ビン間のスペクトル相関をモデル化する。
  • ネットワークは再構成損失と知覚的指標の組み合わせにより学習され、話者分離のためには順列不変訓練が適用される。
  • 両ブランチからの特徴マップはRAブロックを経由して処理され、最終出力生成の前に段階的に表現が精錬される。

実験結果

リサーチクエスチョン

  • RQ1クロスブランチ相互作用を用いた音声とノイズの同時モデリングは、単方向の音声のみのモデリングに比べ、音声強調性能を向上させることができるか?
  • RQ2時間および周波数次元にわたる自己アテンション機構の統合は、ノイズのある音声における特徴表現にどのような影響を与えるか?
  • RQ3音声ブランチとノイズブランチ間の相互作用は、どの程度残存ノイズと音声歪みを低減するか?
  • RQ4提案された二本の分岐型フレームワークは、話者分離に効果的に拡張可能であり、既存のSOTA手法と比較してどのように性能を発揮するか?
  • RQ5RAブロックと相互作用モジュールは、多様なノイズタイプにわたる全体的な強調品質と耐性向上に、それぞれどの程度寄与しているか?

主な発見

  • Voice Bank + DEMAND においてSN-NetはPESQスコア3.12を達成し、GANベースや自己アテンションモデルを含むすべての比較SOTA手法を上回った。
  • DNS Challenge データセットでは、SN-NetはSDRi 8.39 dB、PESQ 2.50を達成し、Conv-TasNet(SDRi: 7.57 dB、PESQ: 2.14)を0.82 dBおよび0.36ポイント上回った。
  • 相互作用モジュールは性能向上に大きく寄与しており、アブレーションスタディにより、残存ノイズの低減と音声の明瞭性向上におけるその中心的役割が確認された。
  • RAブロックは、音声ではグローバルな注目、ノイズでは局所的なパターンを示すアテンションマップを通じて、長距離の時間的および周波数的依存関係を効果的に捉えていることが裏付けられた。
  • 話者分離においても、SN-NetはConv-TasNetを0.82 dBおよび0.36ポイント上回り、マルチソース分離への優れた汎用性を示した。
  • 両データセットにおいてSN-Netはすべての指標で最高スコアを記録し、多様なノイズ条件下でも優れた耐性と強調品質を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。