Skip to main content
QUICK REVIEW

[論文レビュー] DCCRN+: Channel-wise Subband DCCRN with SNR Estimation for Speech Enhancement

Shubo Lv, Yanxin Hu|arXiv (Cornell University)|Jun 16, 2021
Speech and Audio Processing参考文献 34被引用数 7
ひとこと要約

DCCRN+ は、学習可能なフィルタ、複素数TF-LSTM、畳み込みスキップ接続、事前SNR推定、および後処理を組み合わせたサブバンド処理フレームワークを導入し、音声品質を向上させながらノイズを抑制する。Interspeech 2021 DNSチャレンジにおいて3.51のMOSを達成し、DCCRNや他の最先端モデルを上回るPESQおよびDNSMOSスコアを記録した。

ABSTRACT

Deep complex convolution recurrent network (DCCRN), which extends CRN with complex structure, has achieved superior performance in MOS evaluation in Interspeech 2020 deep noise suppression challenge (DNS2020). This paper further extends DCCRN with the following significant revisions. We first extend the model to sub-band processing where the bands are split and merged by learnable neural network filters instead of engineered FIR filters, leading to a faster noise suppressor trained in an end-to-end manner. Then the LSTM is further substituted with a complex TF-LSTM to better model temporal dependencies along both time and frequency axes. Moreover, instead of simply concatenating the output of each encoder layer to the input of the corresponding decoder layer, we use convolution blocks to first aggregate essential information from the encoder output before feeding it to the decoder layers. We specifically formulate the decoder with an extra a priori SNR estimation module to maintain good speech quality while removing noise. Finally a post-processing module is adopted to further suppress the unnatural residual noise. The new model, named DCCRN+, has surpassed the original DCCRN as well as several competitive models in terms of PESQ and DNSMOS, and has achieved superior performance in the new Interspeech 2021 DNS challenge

研究の動機と目的

  • 騒音環境下での音声品質を向上させるとともに、計算コストを低く抑え、リアルタイム性能を維持すること。
  • ディープラーニングベースの音声強調におけるノイズ抑制と音声歪みのトレードオフを解消すること。
  • DCCRNフレームワークにおけるアーキテクチャ的革新を通じて、時間的モデリングと特徴表現を向上させること。
  • エンドツーエンドで学習可能で、コンパクトかつ効率的であり、リアルタイム応用に適した音声強調システムを開発すること。

提案手法

  • 固定FIRフィルタの代わりに、サブバンド分解および再構成に学習可能なニューラルネットワークフィルタを導入し、エンドツーエンド学習と高速な推論を可能にした。
  • 時間軸および周波数軸の両方にわたる時間的依存性を複素数値再帰ユニットを用いてモデル化する複素数TF-LSTMブロックを導入した。
  • エンコーダーとデコーダー間の直接的なスキップ接続を、特徴表現を統合・精錬する畳み込みパスウェイに置き換え、より洗練された特徴を実現した。
  • デコーダー内に補助的な事前SNR推定モジュールを統合し、音声品質の維持を目的としたマルチタスク学習の目的関数とした。
  • 残存ノイズを抑制し、主観的品質を向上させるために、MMSE-LSAに基づく後処理モジュールを適用した。
  • 複素数値スペクトログ램を最適化した複素数畳み込みおよび逆畳み込み層を備えた対称的エンコーダ-デコーダアーキテクチャを採用した。

実験結果

リサーチクエスチョン

  • RQ1学習可能なサブバンドフィルタは、音声品質を損なわずに推論速度とモデルのコンパクト性を向上させることができるか?
  • RQ2標準LSTMの代わりに複素数TF-LSTMを採用することで、時間的モデリングが向上し、強調性能が向上するか?
  • RQ3エンコーダーとデコーダーの層間に畳み込みパスウェイを設けることで、特徴表現とノイズ抑制が向上するか?
  • RQ4補助タスクとしての事前SNR推定の統合により、主観的音声品質が向上するか?
  • RQ5後処理により、残存ノイズがさらに低減され、主観的聴取品質が向上するか?

主な発見

  • DCCRN+ は、Voice Bank + DEMAND データセットにおいてPESQ 3.32を達成し、元のDCCRNと比較して0.04の向上を示した。
  • 学習可能なサブバンドフィルタを搭載したモデルは、リアルタイム要因(RTF)が0.137に達し、FIRフィルタを用いたサブバンド版よりも顕著に高速であった。
  • 複素数TF-LSTMの追加により、学習可能なフィルタを備えたサブバンドDCCRNと比較して、PESQが0.05向上した。
  • SNR推定モジュールの導入により、PESQが0.03向上し、音声品質の維持に寄与することが確認された。
  • DNS-2021のブレインドテストセットにおいて、DCCRN+ はDNSMOSスコア3.46を達成し、全20件の提出物の中で最高となった。
  • 主観的P.835 MOS評価では、DCCRN+ は全体でMOS 3.51を達成し、ワイドバンドトラックで上位4位以内にランクインした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。