Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Speech Domain Adaptation Based on Disentangled Representation Learning for Robust Speech Recognition

Jong-Hyeon Park, Myungwoo Oh|arXiv (Cornell University)|Apr 12, 2019
Speech Recognition and Synthesis参考文献 18被引用数 7
ひとこと要約

本論文は、音声の文脈とドメイン特徴を分離する表現学習を用いたGANベースの教師なし音声ドメイン適応手法を提案し、騒音環境下でのロバストな自動音声認識(ASR)を向上させる。2つの専用エンコーダーを用いて文脈とドメインの表現を分離し、適応的インスタンス正規化(AdaIN)を適用することで、音声内容を保持したまま騒音を効果的に除去する。CHiME4コーパスにおいて、シミュレートされたノイズ付き発話では平均6.55%、実記録発話では15.70%の相対的WER低減を達成し、ノイズ除去およびジェンダー不一致の音声適応の両方で有効性を示した。

ABSTRACT

In general, the performance of automatic speech recognition (ASR) systems is significantly degraded due to the mismatch between training and test environments. Recently, a deep-learning-based image-to-image translation technique to translate an image from a source domain to a desired domain was presented, and cycle-consistent adversarial network (CycleGAN) was applied to learn a mapping for speech-to-speech conversion from a speaker to a target speaker. However, this method might not be adequate to remove corrupting noise components for robust ASR because it was designed to convert speech itself. In this paper, we propose a domain adaptation method based on generative adversarial nets (GANs) with disentangled representation learning to achieve robustness in ASR systems. In particular, two separated encoders, context and domain encoders, are introduced to learn distinct latent variables. The latent variables allow us to convert the domain of speech according to its context and domain representation. We improved word accuracies by 6.55~15.70\% for the CHiME4 challenge corpus by applying a noisy-to-clean environment adaptation for robust ASR. In addition, similar to the method based on the CycleGAN, this method can be used for gender adaptation in gender-mismatched recognition.

研究の動機と目的

  • 訓練環境とテスト環境のドメイン不一致により発生するASRシステムの性能低下を是正すること。特に騒音環境や不一致条件下での性能低下に焦点を当てる。
  • ソースドメインとターゲットドメイン間のペairedデータを必要としない教師なしドメイン適応手法の開発。
  • 音声の内容とドメイン固有の属性(例:ノイズ種別、話者識別子)を分離することで、より正確な適応を実現し、ASRのロバスト性を向上させること。
  • フォルマントや高調波といった重要な音声特徴を保持しつつ、汚染されるノイズを除去する効果的な音声対音声変換を可能にすること。

提案手法

  • メルスペクトログラムから分離された潜在表現を学習するため、文脈エンコーダーとドメインエンコーダーの2つの別個のエンコーダーを導入。
  • 潜在変数が異なる事前分布に従うように制約を課すことにより、内容とドメイン属性の分離を確保。
  • コンテンツを保持しつつスタイル転送を実現するため、生成器にドメイン固有の潜在コードを注入するために適応的インスタンス正規化(AdaIN)を適用。
  • 周期的整合性損失と対抗的損失を組み合わせたGANフレームワークを用い、現実的かつ一貫性のある音声特徴変換を保証。
  • ソースドメインとターゲットドメインの未ペアなメルスペクトログラム上でエンドツーエンドに学習を実行し、ゼロショット適応を可能にする。
  • CNNベースのアーキテクチャ内に残差ネットワークと全結合層を統合し、強固な特徴学習と生成性能を実現。

実験結果

リサーチクエスチョン

  • RQ1ペアデータを必要としない分離表現学習は、教師なし音声ドメイン適応において、ロバストなASRを向上させるか?
  • RQ2提案手法は、背景ノイズを除去しつつ、音声の内容(例:フォルマント、高調波)をどれほど効果的に保持できるか?
  • RQ3本手法は、ノイズあり→クリアおよびジェンダー不一致の両方の音声適応シナリオに一般化可能か?
  • RQ4分離アプローチは、CycleGANベースの手法と比較して、WER低減効果および音声品質の保持において優れているか?

主な発見

  • 提案手法は、CHiME4開発セットにおいて、シミュレートされたノイズ付き発話で平均6.55%、実記録発話で15.70%のWER低減を達成した。
  • 評価セットでは、シミュレート発話で6.72%、実記録発話で10.88%の相対的WER低減をベースラインと比較して達成した。
  • メルスペクトログラムの可視化により、本手法はCycleGANよりもフォルマントや高調波をより良く保持していることが確認された。
  • ジェンダー不一致認識において、本手法は21.7%のWERを達成したのに対し、CycleGANは22.3%であった。
  • 分離表現学習により、ペアデータがなくても効果的なドメイン転送が可能であり、ゼロショット適応においても高いロバスト性を示した。
  • 本手法はバス、カフェ、歩行者、ストリートなど多様なノイズ種別および話者識別子に対しても適応可能であり、広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。