Skip to main content
QUICK REVIEW

[論文レビュー] Training Speech Enhancement Systems with Noisy Speech Datasets

Koichi Saito, Stefan Uhlich|arXiv (Cornell University)|May 26, 2021
Speech and Audio Processing参考文献 23被引用数 6
ひとこと要約

本稿では、クリアな音声データの代わりに、Mozilla Common Voice などのノイズ混在音声データセットを用いて、ディープラーニングベースの音声強調(SE)システムを訓練する2つの手法を提案する。まず、時間周波数(T-F)ビンにわたる平均化の前にサンプル軸にわたる中央値を計算する、ノイズに起因する誤差を低減するロバストな損失関数を導入する。次に、混合不変訓練(MixIT)のためのノイズ増幅スキームを提示し、一般化性能を向上させる。主な結果として、それぞれPESQが最大0.19および0.27ポイント向上し、クリアなターゲットが存在しないノイズ混在データでの有効な訓練を実証した。

ABSTRACT

Recently, deep neural network (DNN)-based speech enhancement (SE) systems have been used with great success. During training, such systems require clean speech data - ideally, in large quantity with a variety of acoustic conditions, many different speaker characteristics and for a given sampling rate (e.g., 48kHz for fullband SE). However, obtaining such clean speech data is not straightforward - especially, if only considering publicly available datasets. At the same time, a lot of material for automatic speech recognition (ASR) with the desired acoustic/speaker/sampling rate characteristics is publicly available except being clean, i.e., it also contains background noise as this is even often desired in order to have ASR systems that are noise-robust. Hence, using such data to train SE systems is not straightforward. In this paper, we propose two improvements to train SE systems on noisy speech data. First, we propose several modifications of the loss functions, which make them robust against noisy speech targets. In particular, computing the median over the sample axis before averaging over time-frequency bins allows to use such data. Furthermore, we propose a noise augmentation scheme for mixture-invariant training (MixIT), which allows using it also in such scenarios. For our experiments, we use the Mozilla Common Voice dataset and we show that using our robust loss function improves PESQ by up to 0.19 compared to a system trained in the traditional way. Similarly, for MixIT we can see an improvement of up to 0.27 in PESQ when using our proposed noise augmentation.

研究の動機と目的

  • クリアな音声データが不足または入手不可能な状況において、ディープニューラルネットワークベースの音声強調(SE)システムを訓練する課題に対処すること。
  • Mozilla Common Voice などの多様性に富んだがクリアなターゲットを欠く公開可能なノイズ混在音声データセットを用いて、効果的な訓練を可能にすること。
  • ターゲットと人工ノイズのノイズ分布が異なる場合に失敗する既存手法(例:MixIT)の制限を克服すること。
  • ノイズ混在の訓練ターゲットに耐性を持つ損失関数およびデータ増幅戦略の設計により、一般化性能と性能を向上させること。

提案手法

  • サンプル軸にわたる中央値を計算した後、時間周波数(T-F)ビンにわたる平均化を行う、変更された損失関数を提案し、ノイズ混在ターゲットへの感受性を低減する。
  • 実際のノイズと人工ノイズの間で一貫したノイズ分布を確保するため、MixIT用のノイズ増幅スキームを導入し、MixITの独立混合仮定を満たす。
  • スペクトログラムに1024点のFFTと256サンプルのオーバーラップを用いた、UMXベースのモデルに変更された損失関数を適用する。
  • MixIT訓練にはSDR損失を用い、バッチサイズ16、1000エポック、エアリー・ストッピングを適用したAdam最適化手法を採用する。
  • 人工ノイズ増幅にDEMANDデータセットを用い、トレーニング中に多様かつ現実的なノイズを確保する。
  • 主な評価指標としてPESQを用い、VBD、DNSドライ、DNSリバーブレートテストセットでモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1サンプル軸にわたる中央値を計算する損失関数が、ノイズ混在音声データセットでのトレーニングにおいて音声強調性能を向上させるか?
  • RQ2ターゲットが本質的にノイズ混在である場合に、MixITトレーニングにおけるノイズ増幅が一般化性能と性能を向上させるか?
  • RQ3ノイズ混在データでのトレーニングにおいて、提案された損失関数は標準的なMSE損失と比較してPESQ向上にどの程度寄与するか?
  • RQ4ターゲットと人工ノイズのノイズ分布が不一致である場合に、MixITがノイズ混在音声データセットに効果的に適用可能か?

主な発見

  • 提案された「サンプル中央値、T-Fビン平均」損失関数は、ノイズ混在のMozilla Common Voiceデータでトレーニングした場合、標準的なMSE損失と比較してPESQが最大0.19ポイント向上した。
  • 同じ損失関数は、VBDテストセットでクリアなVBDデータでトレーニングしたモデルと同等のPESQスコアを達成した。
  • MixIT用に提案されたノイズ増幅スキームは、MCVの有効または無効データでトレーニングし、VBDで評価した場合、PESQが最大0.27ポイント向上した。
  • 新しい損失関数と増幅手法を用いてトレーニングしたモデルは、DNSドライおよびリバーブレートテストセットでも優れた性能を示し、一般化性能が向上したことが裏付けられた。
  • 手動による点検では、増幅されたMixIT設定により、複数のブランチに音声が適切に分離されたバランスの取れた出力が得られたのに対し、元のバージョンでは音声の分離が不十分であった。
  • 提案手法は、従来のトレーニングおよび元のMixITを上回り、特にノイズ混在およびリバーブレートテストセットで優れた性能を示し、ロバスト性と一般化性能が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。