Skip to main content
QUICK REVIEW

[論文レビュー] Deep Noise Suppression With Non-Intrusive PESQNet Supervision Enabling the Use of Real Training Data

Ziyi Xu, Maximilian Strake|arXiv (Cornell University)|Mar 31, 2021
Speech and Audio Processing参考文献 34被引用数 4
ひとこと要約

本稿では、クリアなリファレンスを必要とせず、実際のノイズあり音声データを用いた学習を可能にする弱教師付きの深層ノイズ抑制フレームワークを提案する。合成データと実データの両方を用い、複雑なマスクベースのFCRNとPESQNetを交互に訓練することで、DNS3ベースラインに対して0.09 MOS向上を達成し、背景ノイズの質において0.45 MOS向上を示した。これは、GANを用いない、リファレンスフリーな音声強調学習において、実データを初めて効果的に活用した初の試みである。

ABSTRACT

Data-driven speech enhancement employing deep neural networks (DNNs) can provide state-of-the-art performance even in the presence of non-stationary noise. During the training process, most of the speech enhancement neural networks are trained in a fully supervised way with losses requiring noisy speech to be synthesized by clean speech and additive noise. However, in a real implementation, only the noisy speech mixture is available, which leads to the question, how such data could be advantageously employed in training. In this work, we propose an end-to-end non-intrusive PESQNet DNN which estimates perceptual evaluation of speech quality (PESQ) scores, allowing a reference-free loss for real data. As a further novelty, we combine the PESQNet loss with denoising and dereverberation loss terms, and train a complex mask-based fully convolutional recurrent neural network (FCRN) in a "weakly" supervised way, each training cycle employing some synthetic data, some real data, and again synthetic data to keep the PESQNet up-to-date. In a subjective listening test, our proposed framework outperforms the Interspeech 2021 Deep Noise Suppression (DNS) Challenge baseline overall by 0.09 MOS points and in particular by 0.45 background noise MOS points.

研究の動機と目的

  • クリアなリファレンス信号が欠如する実際のノイズあり音声データを用いた深層音声強調モデルの学習の課題に対処すること。
  • 強調信号から直接PESQスコアを推定することで、リファレンスフリーな知覚的損失関数を構築し、実データを用いた学習を可能にすること。
  • 強調モデルが学習中にそれらを狙うことで性能が低下する既存の学習済み品質指標(例:Quality-Net)の限界を克服すること。
  • 合成データと実データを組み合わせた弱教師付き学習プロトコルにより、実世界のテストデータにおける汎化性と性能を向上させること。
  • GANを用いない、知覚的駆動型の学習において、実データを効果的に活用できることを示すこと。

提案手法

  • クリアなリファレンスにアクセスせずに、強調信号からPESQスコアを推定するエンドツーエンドの非侵襲的PESQNetを提案し、リファレンスフリーな学習を可能にする。
  • FCRNとPESQNetの間を交互に更新する弱教師付き学習プロトコル(1-1-50)を導入。各サイクルでは、合成データ、実データ、再び合成データを用い、PESQNetの最新性を保つ。
  • 先行研究(Jsynth_u)で得られたノイズ除去および反響除去損失とPESQNet損失を組み合わせ、知覚的品質と信号忠実度のバランスを取る総損失Jtotal_uを形成する。
  • 複雑なマスクベースの完全畳み込み再帰的ネットワーク(FCRN)を音声強調に用い、合成データ(Jsynth_u用)と実データ(PESQNet損失用)の両方で訓練する。
  • PESQNetを最新のFCRN出力に基づいて定期的に再訓練することで、分布シフトや精度低下を防ぐ、新規なトレーニングスケジュールを採用する。
  • DNSMOSおよび主観的MOS(ITU-T P.835)を用い、DNS3ブラインドテストセットも含む実世界のテストセットでの性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1クリアなリファレンス信号が得られない状況下でも、実際のノイズあり音声データを効果的に用いて深層音声強調モデルを学習できるか?
  • RQ2非侵襲的PESQNetが、安定的で微分可能かつ知覚的に意味のある損失関数として、実データ学習に適しているか?
  • RQ3強調ネットワークとPESQNetの交互学習が、分布シフトやモデルの悪用による性能低下を防げるか?
  • RQ4PESQNet損失を介して実データを統合することで、完全に合成データでの学習に比べ、実世界のテストセットでの性能が向上するか?
  • RQ5生成的敵対的ネットワーク(GAN)を用いずに、実データで効果的な最先端の性能を達成することは可能か?

主な発見

  • 提案フレームワークは、ブラインドテストセットにおいてDNS3チャレンジベースラインを0.09MOSポイント上回り、顕著な主観的改善を示した。
  • 背景ノイズの質において0.45MOSポイントの向上を達成し、自然さやノイズ特性の保持が向上したことを示した。
  • DNS3開発セットの実データにおいて、モデルはDNSMOSスコア3.33を達成し、完全な実データアクセスを持つオラクル設定を除き、他のすべての手法を上回った。
  • α=0.9の1-1-50トレーニングプロトコルにより、限られた実データ(4時間)でも、合成データのみのベースラインに比べ0.02ポイントのDNSMOS向上を達成し、実データの有効活用が可能であることが示された。
  • FCRNとPESQNetの交互学習により、固定された品質ネットワークを用いた先行研究で報告された性能低下問題が効果的に緩和され、PESQNetの信頼性が時間経過にわたり維持された。
  • 本研究は、知覚的でリファレンスフリーな損失関数を用い、GANを用いない実ノイズありデータを用いた音声強調モデルの学習が、初めて効果的に実現可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。