Skip to main content
QUICK REVIEW

[論文レビュー] Dense CNN with Self-Attention for Time-Domain Speech Enhancement

Ashutosh Pandey, DeLiang Wang|arXiv (Cornell University)|Sep 3, 2020
Speech and Audio Processing参考文献 47被引用数 7
ひとこと要約

本稿では、時域音声強調のための密接な畳み込みネットワークに自己注意機構を組み合わせた手法を提案する。特徴再利用のための密接ブロックと、自己注意による文脈集約を組み合わせ、音声の振幅と位相を同時に強調する。本手法は、新たな位相制約付き振幅損失(PCM)を用いて、複数のノイズ条件下で因果的および非因果的設定において、先行手法を著しく上回る最先端の性能を達成する。

ABSTRACT

Speech enhancement in the time domain is becoming increasingly popular in recent years, due to its capability to jointly enhance both the magnitude and the phase of speech. In this work, we propose a dense convolutional network (DCN) with self-attention for speech enhancement in the time domain. DCN is an encoder and decoder based architecture with skip connections. Each layer in the encoder and the decoder comprises a dense block and an attention module. Dense blocks and attention modules help in feature extraction using a combination of feature reuse, increased network depth, and maximum context aggregation. Furthermore, we reveal previously unknown problems with a loss based on the spectral magnitude of enhanced speech. To alleviate these problems, we propose a novel loss based on magnitudes of enhanced speech and a predicted noise. Even though the proposed loss is based on magnitudes only, a constraint imposed by noise prediction ensures that the loss enhances both magnitude and phase. Experimental results demonstrate that DCN trained with the proposed loss substantially outperforms other state-of-the-art approaches to causal and non-causal speech enhancement.

研究の動機と目的

  • 時域音声強調における音声の振幅と位相を同時に強調する課題に対処すること。
  • SNR改善の不一致を引き起こし、アーチファクトを生じさせる、振幅のみの損失関数の限界を克服すること。
  • 密接ブロックと自己注意を用いて、時域音声強調における特徴抽出と文脈モデリングを向上させること。
  • さまざまなノイズタイプとSNRレベルに一般化できるリアルタイム対応で非因果的なアーキテクチャを開発すること。
  • 学習済みコーパスを超えたDNNベース音声強調の一般化能力を調査すること。

提案手法

  • 提案アーキテクチャは、スキップ接続を備えたエンコーダ・デコーダフレームワークを採用し、各エンコーダおよびデコーダ層に密接ブロックと自己注意モジュールを含む。
  • 密接ブロックは、層間の特徴マップを連結することで、特徴の再利用とより深いネットワーク学習を可能にする。
  • 自己注意機構により、入力シーケンス内の関連フレームに注目することで、繰り返し現れる音素や周期的構造のモデリングを向上させる。
  • 新たな損失関数、PCM(位相制約付き振幅損失)は、強調された音声の振幅と予測されたノイズの振幅を組み合わせ、位相推定を暗黙的に制約する。
  • この損失関数は、SNRの整合性を向上させるとともに、アーチファクトを低減し、高い客観的品質スコアを維持することを目的として設計されている。
  • モデルはWSJコーパスで学習され、未学習のWSJ発話者での評価により、コーパス間一般化性能が評価されている。

実験結果

リサーチクエスチョン

  • RQ1密接CNNに自己注意を組み合わせたアーキテクチャは、時域音声強調において振幅と位相の両方を効果的に強調できるか?
  • RQ2ノイズ予測を組み込んだ振幅ベースの損失関数は、標準的なスペクトル振幅損失と比較して、より良い位相推定とアーチファクトの低減をもたらすか?
  • RQ3提案されたネットワークにおける注意機構は、関連する音声セグメントにどのように注目するか?また、因果的および非因果的推論においてその挙動はどのように異なるか?
  • RQ4提案されたモデルは、学習データにない発話者やノイズタイプに対しても一般化可能か?
  • RQ5受容 field のサイズと拡張率(dilation)が、時域音声強調における性能に与える影響は何か?

主な発見

  • PCM損失を用いた提案されたDCNは、因果的および非因果的設定の両方で、すべてのベースラインモデルを上回り、STOIで平均1.3%の向上、PESQでNC-GCRNと比較して0.21の向上を達成した(p < 0.0001、統計的有意性を示す)。
  • リアルタイム対応版であるDCN-PCMは、最良のリアルタイムベースラインであるTCNNと比較して、STOIで1.5%向上、PESQで0.19向上を達成した。
  • 注意マップの結果、非因果的DCNは発話部(フレーム125~185)と高周波成分に注目しているが、因果的DCNは因果性制約のため、より前のフレームに注目がシフトしている。
  • 因果的DCNにおける注意機構は、非因果的DCNと比較して鋭く、時間的制約下での文脈選択がより集中している。
  • PCM損失は、SNR改善の不整合を解消し、振幅のみの損失学習で見られる未知のアーチファクトを低減する一方で、高い客観的スコアを維持している。
  • 拡張率を使用しない状態でも、小さな受容 field と自己注意を備えた提案されたDCNは、拡張畳み込みを用いたモデルを上回る性能を示しており、アーキテクチャ設計の有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。