[論文レビュー] Exploring Machine Speech Chain for Domain Adaptation and Few-Shot Speaker Adaptation
本論文は、ターゲットドメインの音声データを一切使用せず、テキストデータのみを用いてドメインおよびフェイシュットスプーカー適応を実現する機械的音声チェーンフレームワークを提案する。ターゲットドメインのテキストから合成音声を生成し、ASRフィードバックを用いることで、E2E ASRで10%の相対的WER低減、TED-LIUMにおけるTTS生成音声で51.5%の相対的WER低減を達成した。さらに、フェイシュットスプーカー適応により2.6%の相対的WER改善が得られた。
Machine Speech Chain, which integrates both end-to-end (E2E) automatic speech recognition (ASR) and text-to-speech (TTS) into one circle for joint training, has been proven to be effective in data augmentation by leveraging large amounts of unpaired data. In this paper, we explore the TTS->ASR pipeline in speech chain to do domain adaptation for both neural TTS and E2E ASR models, with only text data from target domain. We conduct experiments by adapting from audiobook domain (LibriSpeech) to presentation domain (TED-LIUM), there is a relative word error rate (WER) reduction of 10% for the E2E ASR model on the TED-LIUM test set, and a relative WER reduction of 51.5% in synthetic speech generated by neural TTS in the presentation domain. Further, we apply few-shot speaker adaptation for the E2E ASR by using a few utterances from target speakers in an unsupervised way, results in additional gains.
研究の動機と目的
- E2E ASRおよびニューラルTTSにおけるテキストドメインおよびスプーカーのばらつきの不一致を、共同学習フレームワークを用いて解消すること。
- ターゲットドメインのペアド音声-テキストデータを一切必要としない、ASRおよびTTSのドメイン適応を可能にすること。
- TTSによる合成音声生成とASRフィードバックを活用することで、非教師付きフェイシュットスプーカー適応を検討すること。
- 機械的音声チェーンの有効性を、ドメイン外テキストおよび未学習スプーカーに対する耐性および性能向上の観点から評価すること。
提案手法
- 本手法は、TTS→ASRパイプラインを含む機械的音声チェーンに基づくもので、TTSがターゲットドメインのテキストから合成音声を生成し、ASRが交差エントロピー損失を介してフィードバックを提供することで、両モデルの改善を図る。
- 共同学習により、合成音声に対するASR損失を用いてASRおよびTTSモデルを同時に更新することで、ターゲットドメインの音声的および言語的表現を学習可能にする。
- ドメイン適応のため、TTSモデルはターゲットドメイン(TED-LIUM)のテキストを用いてファインチューニングされ、その結果得られた合成音声を用いてASRモデルが学習され、ドメイン不一致が低減される。
- フェイシュットスプーカー適応のため、ターゲットスプーカーの少数の参照発話がTTSモデルに条件付けられ、その結果得られたスプーカー固有の合成音声がASRのファインチューニングに使用される。
- フレームワークは、アテンションベースのE2E ASRおよびTacotron2ベースのTTSを採用し、トレーニングの安定性と性能向上のため、ガイドドアテンションと交差エントロピー損失を用いる。
- トレーニング戦略には、両モデルの共同最適化と、TTSを固定したままASRのみをファインチューニングする戦略を含め、性能および耐性への影響を評価する。
実験結果
リサーチクエスチョン
- RQ1機械的音声チェーンにおけるTTS→ASRパイプラインは、ターゲットドメインのテキストのみを用いて、ASRおよびTTSにおけるドメイン不一致を効果的に低減できるか?
- RQ2TTSとASRの共同学習は、ドメイン外テキストに対するニューラルTTSのアテンションエラーを低減し、耐性を向上させるか?
- RQ3音声チェーンフレームワークにおいて、合成音声生成とASRフィードバックを活用することで、非教師付きフェイシュットスプーカー適応はどの程度達成可能か?
- RQ4ターゲットドメインからの合成データを用いた共同学習は、実際のターゲットドメインテストセットにおけるASR性能を向上させるが、元のドメイン性能を劣化させないか?
主な発見
- 提案されたドメイン適応手法により、TED-LIUMテストセットにおけるE2E ASRのWERが25.9%から23.3%に10%の相対的低減が達成された。
- ニューラルTTSは、ターゲットドメインのテキストから生成された合成音声において、51.5%の相対的WER低減を示し、アテンションの耐性向上が顕著に確認された。
- ソースドメイン(LibriSpeech)におけるTTS性能も、相対的に16.9%のWER低減を達成し、共同学習による一般化効果が示された。
- スプーカー適応に1つの参照発話のみを用いた場合、ASRのWERが2.6%相対的に低減され、5つの参照を使用した場合にさらに改善が得られた。
- ASRとTTSの両方を共同で学習させることでTTSの耐性が向上したが、ASRのみをファインチューニングした場合、やや高いASR性能が得られたことから、モデル改善のトレードオフが示された。
- 可視化解析により、共同学習後のTacotron2では、特にドメイン外テキストにおいてアテンションの整合性が向上したことが確認され、アテンションエラーの低減が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。