Skip to main content
QUICK REVIEW

[論文レビュー] S-DCCRN: Super Wide Band DCCRN with learnable complex feature for speech enhancement

Shubo Lv, Yihui Fu|arXiv (Cornell University)|Nov 16, 2021
Speech and Audio Processing被引用数 4
ひとこと要約

本稿では、サブバンドおよびフルバンド処理を統合し、学習可能な複素数特徴符号化と学習可能なスペクトル圧縮を組み合わせた、32 kHz信号向けのスーパー広帯域音声強調モデルS-DCCRNを提案する。段階的なサブバンドおよびフルバンドDCCRNアーキテクチャ、エンドツーエンドの複素数特徴符号化/復号化、および学習可能なスペクトル圧縮による自己調整エネルギー制御を統合することで、S-DCCRNはDNS-2021の盲テストセットで3.62のMOSスコアを達成し、PercepNetや他の最先端モデルを上回る最先端の性能を発揮した。

ABSTRACT

In speech enhancement, complex neural network has shown promising performance due to their effectiveness in processing complex-valued spectrum. Most of the recent speech enhancement approaches mainly focus on wide-band signal with a sampling rate of 16K Hz. However, research on super wide band (e.g., 32K Hz) or even full-band (48K) denoising is still lacked due to the difficulty of modeling more frequency bands and particularly high frequency components. In this paper, we extend our previous deep complex convolution recurrent neural network (DCCRN) substantially to a super wide band version -- S-DCCRN, to perform speech denoising on speech of 32K Hz sampling rate. We first employ a cascaded sub-band and full-band processing module, which consists of two small-footprint DCCRNs -- one operates on sub-band signal and one operates on full-band signal, aiming at benefiting from both local and global frequency information. Moreover, instead of simply adopting the STFT feature as input, we use a complex feature encoder trained in an end-to-end manner to refine the information of different frequency bands. We also use a complex feature decoder to revert the feature to time-frequency domain. Finally, a learnable spectrum compression method is adopted to adjust the energy of different frequency bands, which is beneficial for neural network learning. The proposed model, S-DCCRN, has surpassed PercepNet as well as several competitive models and achieves state-of-the-art performance in terms of speech quality and intelligibility. Ablation studies also demonstrate the effectiveness of different contributions.

研究の動機と目的

  • スーパーワイドバンド(32 kHz)音声強調のための効果的なディーブラーニングモデルの欠如に取り組む。これは、高周波成分のモデリングとスペクトル次元の増加という課題を伴う。
  • 局所的(サブバンド)およびグローバル(フルバンド)周波数情報の両方を活用することで、高精細音声強調における音声品質と聞き取りやすさを向上させる。
  • 固定スペクトル圧縮手法の限界を克服するため、周波数帯域ごとのエネルギー分布を動的に調整できる学習可能なスペクトル圧縮メカニズムを導入する。
  • エンドツーエンドで学習可能な複素数特徴エンコーダーとデコーダーを用いて、入力および出力表現を精緻化し、特徴の忠実性とノイズ抑制性能を向上させる。

提案手法

  • モデルは、2つの軽量DCCRNサブモジュール(低周波および高周波帯域別処理用とフルバンド統合用)を用いた段階的なサブバンドおよびフルバンド(SAF)処理モジュールを採用する。これにより、帯域間遷移のなめらかさが向上する。
  • STFT後に複素数特徴エンコーダー(CFE)を適用して入力特徴を精緻化し、iSTFTの前に複素数特徴デコーダー(CFD)を用いて時間周波数表現を再構成する。両者ともエンドツーエンドで学習される。
  • 学習可能なスペクトル圧縮(LSC)を導入し、周波数帯域ごとのエネルギーを適応的に調整する。圧縮比は学習中に最適化され、高周波成分の詳細を保持する。
  • サブバンドDCCRNではグループ複素数畳み込みを用い、低周波および高周波成分を別々に処理することで、モデリング効率と性能が向上する。
  • サブバンドおよびフルバンド両ブランチにおけるエンコーダーとデコーダー間のスキップ接続により、特徴の整合性が保持され、情報損失が低減される。
  • 最終的なモデルS-DCCRNは、SAFモジュール、CFE/CFD、およびLSCを統合し、32 kHzサンプリングレートで優れたノイズ抑制と音声品質を実現する。
Fig. 1 : Network structure of the proposed S -DCCRN
Fig. 1 : Network structure of the proposed S -DCCRN

実験結果

リサーチクエスチョン

  • RQ1段階的なサブバンドおよびフルバンド処理アーキテクチャは、32 kHzのスーパー広帯域信号における音声強調性能を向上させ得るか?
  • RQ2標準的なSTFT入力と比較して、エンドツーエンドで学習可能な複素数特徴符号化および復号化は、特徴表現と音声品質を向上させるか?
  • RQ3学習可能なスペクトル圧縮は、高周波成分の保持と全体のノイズ除去性能をどの程度向上させるか?
  • RQ4PercepNet や DCCRN といった最先端モデルと比較して、S-DCCRN は客観的および主観的音声品質指標においてどのように差をつけるか?

主な発見

  • S-DCCRNはDNS-2021の盲テストセットで3.62の平均意見スコア(MOS)を達成し、RNNoise(2.32)、DCCRN(3.30)、PercepNet(2.73)を著しく上回った。
  • SAFモジュール単体でもベースラインDCCRNに比べてPESQが0.17向上し、モデルサイズは小さく抑えられている。これはサブバンドとフルバンドの統合の有効性を示している。
  • 学習可能なスペクトル圧縮(LSC)を追加することで、PESQがさらに0.07向上した。固定圧縮と比較して、高周波エネルギーをより効果的に保持していることがわかった。
  • CFE/CFDブロック単体では高周波エネルギーが低いため性能が低かったが、LSCと組み合わせることで、SAFモジュール単体に比べてPESQが0.08向上した。
  • 学習されたスペクトル圧縮比は、13 kHzを超える高周波帯域が約0.5に抑えられる傾向にあり、重要な知覚的詳細が保持されている。
  • VoiceBankおよびDEMANDデータセットでは、S-DCCRNはPESQ 2.84、CSIG 4.03、STOI 0.940を達成し、複数の指標で最先端の性能を示した。
Fig. 2 : Complex feature encoder/decoder (CFE/CFD) module
Fig. 2 : Complex feature encoder/decoder (CFE/CFD) module

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。