Skip to main content
QUICK REVIEW

[論文レビュー] MetricGAN-U: Unsupervised speech enhancement/ dereverberation based only on noisy/ reverberated speech

Szu‐Wei Fu, Cheng Yu|arXiv (Cornell University)|Oct 12, 2021
Speech and Audio Processing被引用数 8
ひとこと要約

MetricGAN-U は、クリアな音声やノイズの参照が不要な完全に教師なしの音声強調およびエコー除去フレームワークを提案する。この手法は、ノイズありまたはエコーあり音声のみを用いて、非侵襲的音声品質指標を最適化することで学習を行う。実験の結果、客観的および主観的評価において既存のベースラインを上回り、厳密な教師なし条件下で最先端の性能を達成している。

ABSTRACT

Most of the deep learning-based speech enhancement models are learned in a supervised manner, which implies that pairs of noisy and clean speech are required during training. Consequently, several noisy speeches recorded in daily life cannot be used to train the model. Although certain unsupervised learning frameworks have also been proposed to solve the pair constraint, they still require clean speech or noise for training. Therefore, in this paper, we propose MetricGAN-U, which stands for MetricGAN-unsupervised, to further release the constraint from conventional unsupervised learning. In MetricGAN-U, only noisy speech is required to train the model by optimizing non-intrusive speech quality metrics. The experimental results verified that MetricGAN-U outperforms baselines in both objective and subjective metrics.

研究の動機と目的

  • 教師あり音声強調モデルが訓練にペアのクリア音声とノイズあり音声を必要とするという制限に対処すること。
  • 既存の教師なし手法が依然として訓練中にクリア音声やノイズを必要としているという制約を克服すること。
  • クリア音声やノイズの参照に依存せず、ノイズありまたはエコーあり音声のみを用いて学習するフレームワークを構築すること。
  • クリアな参照データが入手不可能な現実世界の状況において、音声強調およびエコー除去の性能を向上させること。
  • 非侵襲的客観的指標のみを用いたエンドツーエンド学習の可能性を実証すること。

提案手法

  • 生成的敵対的ネットワーク(GAN)フレームワークを採用し、識別器は実際のノイズあり音声と生成器が生成した強調音声を区別するように学習する。
  • 生成器は、PESQ や STOI、MOS といった非侵襲的音声品質指標に基づく損失関数で最適化され、事前に学習された指標予測器によって予測される。
  • 指標予測器は、真のクリア音声が不要な別個のニューラルネットワークであり、音声品質を推定する。
  • 訓練はエンドツーエンドで行われ、ペアのクリアデータやノイズ推定値が不要なノイズありまたはエコーあり音声サンプルのみを用いる。
  • 安定性と強調出力の品質を向上させるために、サイクル整合性に類似した正則化を活用する。
  • 識別器は実際のノイズあり音声と強調音声を区別するように学習され、生成器は識別器を欺し、指標スコアを向上させるように最適化される。

実験結果

リサーチクエスチョン

  • RQ1クリア音声の参照が一切ない状況でも、音声強調を効果的に学習できるか?
  • RQ2非侵襲的音声品質指標がエンドツーエンド学習における代替的監視信号として信頼できるか?
  • RQ3指標に基づく損失を用いた GAN フレームワークが、既存の教師なしベースラインを上回る性能を示せるか?
  • RQ4ペアデータが一切ない現実世界のノイズあり・エコーあり環境に一般化できるか?
  • RQ5客観的および主観的評価において、MetricGAN-U の性能は教師ありおよび弱教師ありベースラインと比べてどうか?

主な発見

  • MetricGAN-U は、ノイズありまたはエコーあり音声のみを用いて学習することで、音声強調およびエコー除去において最先端の性能を達成した。
  • PESQ や STOI といった客観的指標において、既存の教師なしおよび弱教師ありベースラインを著しく上回った。
  • 主観的平均評価点(MOS)の評価結果から、強調音声がベースライン手法よりも知覚的に優れていることが確認された。
  • 非侵襲的指標を学習信号として用いることで、クリア音声の監視なしに効果的な最適化が可能になった。
  • 多様なノイズあり・エコーあり環境において良好な一般化性能を示し、現実世界の応用においても頑健であることが確認された。
  • アブレーションスタディの結果、指標に基づく損失と敵対的学習の両方が最適な性能を達成するために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。