Skip to main content
QUICK REVIEW

[論文レビュー] Improving noise robust automatic speech recognition with single-channel time-domain enhancement network

Keisuke Kinoshita, Tsubasa Ochiai|arXiv (Cornell University)|Mar 9, 2020
Speech and Audio Processing参考文献 30被引用数 8
ひとこと要約

本稿では、Conv-TasNetに基づく単一チャネル時間領域音声強調ネットワークであるDenoising-TasNetを提案し、ノイズに強い自動音声認識(ASR)を向上させる。強力なASRバックエンドを用いて、再トレーニングなしで実CHiME-4テストデータにおいて30%以上の相対的語誤り率(WER)低減を達成しており、周波数領域手法をはるかに上回る性能向上を示している。これは、時間領域でのノイズ除去が、周波数領域手法を凌駕するASR性能向上に寄与することを示している。

ABSTRACT

With the advent of deep learning, research on noise-robust automatic speech recognition (ASR) has progressed rapidly. However, ASR performance in noisy conditions of single-channel systems remains unsatisfactory. Indeed, most single-channel speech enhancement (SE) methods (denoising) have brought only limited performance gains over state-of-the-art ASR back-end trained on multi-condition training data. Recently, there has been much research on neural network-based SE methods working in the time-domain showing levels of performance never attained before. However, it has not been established whether the high enhancement performance achieved by such time-domain approaches could be translated into ASR. In this paper, we show that a single-channel time-domain denoising approach can significantly improve ASR performance, providing more than 30 % relative word error reduction over a strong ASR back-end on the real evaluation data of the single-channel track of the CHiME-4 dataset. These positive results demonstrate that single-channel noise reduction can still improve ASR performance, which should open the door to more research in that direction.

研究の動機と目的

  • 最先端の時間領域音声強調が、ノイズに強いASR性能を向上させることを調査すること。
  • エンドツーエンドASRシステムにおいて、時間領域ノイズ除去ネットワークと従来の周波数領域アプローチを比較すること。
  • データ拡張が単一チャネル音声強調およびASR性能に与える影響を評価すること。
  • 強調システムの一般化能力が、異なるデータセットおよびノイズ条件においても有効であるかを評価すること。

提案手法

  • 単一チャネルノイズ除去を目的として、Conv-TasNetアーキテクチャを適応し、雑音混在波形からクリアな音声を再構築するように学習する。
  • 2つのバリエーションを提案:1つは強調音声のみを予測するもの、もう1つは多タスク学習のため、音声とノイズの両方を予測するもの。
  • 音声とノイズの再構築を組み合わせたマルチタスク損失関数を用い、訓練の正則化と一般化性能の向上を図る。
  • 予測波形とターゲット波形の平均二乗誤差に基づく時間領域損失関数を採用する。
  • 耐障害性を向上させるために、10万件の雑音付き発話から構成される大規模な拡張データセットを用いて強調ネットワークを学習する。
  • トレーニング済みの強調フロントエンドを、事前学習済みのASRバックエンド(再トレーニングなし)と統合し、実際の雑音付きデータ上のASR性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1時間領域音声強調ネットワークは、実世界のノイズ混在録音において、ASR性能を顕著に向上させることができるか?
  • RQ2ASRバックエンドをファインチューニングしない状態でも、時間領域ノイズ除去による性能向上がASRに伝播するか?
  • RQ3データ拡張は、単一チャネル強調システムの一般化性能およびASR性能にどのように影響するか?
  • RQ4提案手法の強調方法は、CHiME-4データセット以外の異なるノイズ条件やASRバックエンドに対しても一般化可能か?

主な発見

  • Denoising-TasNetは、ASRバックエンドを再トレーニングしない状態でも、実CHiME-4テストデータにおいて30%以上の相対的語誤り率(WER)低減を達成した。
  • SDR性能がより高いにもかかわらず、FD-BLSTM や FD-Conv-FDL といった周波数領域ベースラインよりも、SDRおよびASR性能で優れた結果を示した。
  • 訓練発話数を35,000件から100,000件に増やしたデータ拡張により、Denoising-TasNetおよびFD-BLSTMの両方のASR性能が顕著に向上した。特にFD-BLSTMは、Enh-AM設定で実CHiME-4データで10.40%のWERを達成した。
  • 強調システムはAurora-4データセットに対しても良好に一般化され、ノイズ混在テストセットのWERを8.5%から6.3%に低下させた。クリアなテストセットでは劣化が最小限に抑えられた。
  • 音声とノイズの別々の出力をもつ多タスク学習は、一般化性能を向上させ、単一出力学習よりも優れたASR性能をもたらした。
  • 結果から、単一チャネル時間領域ノイズ除去が、ノイズに強いASR向上のための実用的で効果的なアプローチであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。