[論文レビュー] AdaDurIAN: Few-shot Adaptation for Neural Text-to-Speech with DurIAN
AdaDurIANは、改良されたDurIANベースの平均モデルを用いたFew-shot適応手法を提案し、わずか数分間の単語言語データでの高品質で自然で話者に似た音声合成を実現する。コンテンツエンコーダーを固定し、話者埋め込みとデコーダーのみを微調整することで、ベースラインのTacotron型モデルと比較して優れた自然さ(3分間のデータでMOS 4.21)と多言語間の頑健な性能を達成する。
This paper investigates how to leverage a DurIAN-based average model to enable a new speaker to have both accurate pronunciation and fluent cross-lingual speaking with very limited monolingual data. A weakness of the recently proposed end-to-end text-to-speech (TTS) systems is that robust alignment is hard to achieve, which hinders it to scale well with very limited data. To cope with this issue, we introduce AdaDurIAN by training an improved DurIAN-based average model and leverage it to few-shot learning with the shared speaker-independent content encoder across different speakers. Several few-shot learning tasks in our experiments show AdaDurIAN can outperform the baseline end-to-end system by a large margin. Subjective evaluations also show that AdaDurIAN yields higher mean opinion score (MOS) of naturalness and more preferences of speaker similarity. In addition, we also apply AdaDurIAN to emotion transfer tasks and demonstrate its promising performance.
研究の動機と目的
- 新しい話者に対して極めて限られた単語言語データで高品質なニューラルTTSシステムを訓練するという課題に対処すること。
- 期間に応じた注意機構と共有された話者に依存しないコンテンツエンコーダーを活用することで、Few-shot話者適応における頑健性と自然さを向上させること。
- わずか数分間のデータで、新しい話者の声に合わせた滑らかな多言語音声合成を実現し、注意ベースのエンドツーエンドTTSモデルの不安定性を克服すること。
- モデルの性能を話者適応およびFew-shot感情転送タスクの両方で評価すること。
提案手法
- DurIANに基づくAdaDurIANを提案し、音節およびトーン/強調のシーケンスの両方のための共有された話者に依存しないコンテンツエンコーダーを備えたFew-shot適応フレームワークを構築する。
- コンテンツエンコーダーを固定し、話者埋め込みとデコーダーヘッドのみを微調整することで、トレーニングの不安定性と発音エラーを低減する。
- ストリーミング推論を改善するために、グローバルなCBHGモジュールに代わる時間遅延付きLSTMポストネットを導入する。
- 期間の監視を伴うウィンドウ化されたコンテンツベースの注意機構を採用することで、アライメントの頑健性を向上させ、注意の崩壊を低減する。
- マルチスプリーカー平均モデルを訓練し、1〜20分間の単語言語データを1スプリーカーあたりのみで微調整により適応する。
- 同じ適応戦略を感情転送タスクに適用し、最小限のデータでニュートラルベースモデルからの感情を転送する。
実験結果
リサーチクエスチョン
- RQ1わずか数分間の単語言語データで、高自然さと話者類似性を維持したまま、1つの平均TTSモデルを新しい話者に効果的に適応できるか?
- RQ2コンテンツエンコーダーを固定し、話者埋め込みとデコーダーのみを微調整することで、Few-shot環境下での発音正確性とアライメントの頑健性にどのような影響を与えるか?
- RQ3対象話者がターゲット言語に事前にデータを持たない場合、AdaDurIANはどの程度多言語音声合成に一般化できるか?
- RQ4AdaDurIANはFew-shot感情転送タスクに成功裏に適用可能か?また、異なる感情スタイル間で性能はどのように比較されるか?
- RQ5MOS、話者類似性、多言語流暢さの観点から、AdaDurIANは標準的なTacotron型モデルと比較してどの程度優れているか?
主な発見
- 3分間の学習データでのみ、中国語話者に対してMOS 4.21を達成し、正解録音のMOSからわずか0.2下回る。
- 中国語データのない英語話者に対し、1分間のデータでのみ中国語文のMOSが3.90に達し、強力な多言語一般化性能を示した。
- 話者類似性の好みテストにおいて、SMAベースラインを上回り、特に英語文において中国語話者に対して顕著な差を示した。
- Few-shot F2F感情転送では平均64%の感情分類精度、F2M転送では52%を達成し、最小限のデータで感情転送に有望な性能を示した。
- 主観的評価により、AdaDurIANはベースラインのTacotron型モデルよりも自然さが高く、話者類似性の好みも上回ることが確認された。
- コンテンツエンコーダーを固定し、話者埋め込みとデコーダーのみを微調整することで、発音エラーと注意の崩壊が顕著に低減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。