Skip to main content
QUICK REVIEW

[論文レビュー] A Cycle-GAN Approach to Model Natural Perturbations in Speech for ASR Applications

Sri Harsha Dumpala, Imran Sheikh|arXiv (Cornell University)|Dec 18, 2019
Speech and Audio Processing参考文献 27被引用数 5
ひとこと要約

本稿では、笑い混じりの発話やかすれ声といった自然な発話の摂動を、並行学習データを必要とせず、通常の発話に変換するサイクル-GANベースのフロントエンドを提案する。この手法は、非並行発話データ上でサイクル整合性のある敵対的訓練を用いて摂動を分離することで、複数のASRシステムにおいて語誤り率(WER)を最大21.0%まで顕著に低減させ、ASRの耐障害性を向上させる。

ABSTRACT

Naturally introduced perturbations in audio signal, caused by emotional and physical states of the speaker, can significantly degrade the performance of Automatic Speech Recognition (ASR) systems. In this paper, we propose a front-end based on Cycle-Consistent Generative Adversarial Network (CycleGAN) which transforms naturally perturbed speech into normal speech, and hence improves the robustness of an ASR system. The CycleGAN model is trained on non-parallel examples of perturbed and normal speech. Experiments on spontaneous laughter-speech and creaky-speech datasets show that the performance of four different ASR systems improve by using speech obtained from CycleGAN based front-end, as compared to directly using the original perturbed speech. Visualization of the features of the laughter perturbed speech and those generated by the proposed front-end further demonstrates the effectiveness of our approach.

研究の動機と目的

  • 最新のASRシステムに自然な発話の摂動(例:笑い、かすれ声)が与える影響を調査すること。
  • 並行学習データを必要とせず、摂動付き発話を通常の発話に変換するデータ効率の良いフロントエンドを開発すること。
  • サイクル整合性のある生成的モデリングを用いて、感情的および音声品質に基づく摂動に対するASRの耐障害性を向上させること。
  • 提案されたフロントエンドの有効性を、多様なASRシステムおよび発話タイプにおいて検証すること。

提案手法

  • サイクル-GANアーキテクチャを採用し、2つの生成器(G_XY と G_YX)および2つの識別器(D_X と D_Y)を用いて、摂動付き発話と通常発話間のドメイン変換を学習する。
  • 生成器は、残差ブロックにゲート付き畳み込みとインスタンス正規化を組み合わせ、スペクトル特徴および非周期的特徴(MFBs と APs)をモデル化することで、表現学習を向上させる。
  • 訓練目的関数には、敵対的損失、サイクル整合性損失、およびアイデンティティ損失を組み合わせ、リアルなかつ一貫性のある発話変換を保証する。
  • フロントエンドは、生の音声からメルフィルタバンク特徴(MFBs)と非周期的成分(APs)を抽出し、それらを通常の発話の分布に近づけるように変換する。
  • モデルは、笑い混じり発話およびかすれ声データセットからの非並行データ上で学習され、ペア例が不要なゼロショットドメイン変換を可能にする。

実験結果

リサーチクエスチョン

  • RQ1サイクル-GANベースのフロントエンドは、笑いやかすれ声といった自然な発話摂動がASR性能に与える悪影響を効果的に軽減できるか?
  • RQ2メルフィルタバンク特徴(MFBs)に加えて非周期的成分(APs)を含めることで、変換された発話の品質および下流のASR精度にどのような影響を与えるか?
  • RQ3提案されたフロントエンドは、異なるASRシステムおよび発話タイプにどの程度一般化可能か?
  • RQ4変換された発話の学習特徴は、通常の発話の特徴と比較して、分布および構造の面でどの程度類似しているか?

主な発見

  • 笑い混じり発話を通常の発話に変換する際、ASpIRE ASRシステムにおいて語誤り率(WER)が21.0%低減された。
  • かすれ声発話では、Google ASRシステムでWERが11.0%、IBM ASRシステムで7.9%低減された。MFBs+APsフロントエンドを用いた場合の結果である。
  • Google ASRシステムにおいて、笑い混じり発話の文誤り率(SER)は最大22.2%まで低減され、文単位の認識精度が向上したことが示された。
  • DeepSpeechモデルでは、言語モデルを搭載しない状態でも、文字誤り率(CER)が15.6%低減された。これは、低リソース環境下でも有効であることを確認するものである。
  • t-SNE可視化により、変換された発話の特徴分布が通常の発話とよく一致していることが確認された。一方、笑い混じり発話特徴はより散らばっており、明確に異なる分布を示していた。
  • メルフィルタバンク出力のビニールプロットでは、変換された発話特徴が通常の発話分布をよく再現しており、フロントエンドが音響的特徴を保持する能力を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。