[論文レビュー] A New GAN-based End-to-End TTS Training Algorithm
この論文では、生成器とディスクリミネータを、実際のシーケンスと生成されたシーケンスの両方で同時に学習させることで、自己回帰的TTSモデルにおける露出バイアスを軽減するGANベースのエンドツーエンドTTS学習アルゴリズムを提案している。この手法は、主観評価において教師強制法とスケジュールドサンプリングを上回り、音声の自然さ(CMOS +0.1)と一般化性能(不明瞭率 11.1% → 4%)を向上させた。
End-to-end, autoregressive model-based TTS has shown significant performance improvements over the conventional one. However, the autoregressive module training is affected by the exposure bias, or the mismatch between the different distributions of real and predicted data. While real data is available in training, but in testing, only predicted data is available to feed the autoregressive module. By introducing both real and generated data sequences in training, we can alleviate the effects of the exposure bias. We propose to use Generative Adversarial Network (GAN) along with the key idea of Professor Forcing in training. A discriminator in GAN is jointly trained to equalize the difference between real and predicted data. In AB subjective listening test, the results show that the new approach is preferred over the standard transfer learning with a CMOS improvement of 0.1. Sentence level intelligibility tests show significant improvement in a pathological test set. The GAN-trained new model is also more stable than the baseline to produce better alignments for the Tacotron output.
研究の動機と目的
- 訓練では実際のシーケンスを使用するが、推論では予測されたシーケンスに依存する自己回帰的エンドツーエンドTTSにおける露出バイアス問題に対処すること。
- 長文や病理的入力などの未知または複雑な入力シーケンスに対しても、モデルの一般化性能とロバスト性を向上させること。
- 実際の音声シーケンスと生成されたシーケンスの分布の乖離を低減することで、音声品質と自然さを向上させること。
- 注意機構のアライメントを安定化させ、長シーケンス生成における誤差蓄積を低減する学習フレームワークの構築
提案手法
- 教師強制(実際の入力)とフリー走行(予測された入力)の両モードで音声シーケンスを生成する生成器(TTSモデル)を用いたGANベースの学習フレームワークを導入する。
- ディスクリミネータを訓練し、実際のシーケンス(教師強制)からの隠れ状態および出力と、生成されたシーケンス(フリー走行)からのものを区別させ、分布の不一致を最小化する。
- 敵対的学習を用いて、実際のデータ分布と生成されたデータ分布を一致させ、訓練中に生成器が自身の予測にさらされるようにすることで露出バイアスを低減する。
- 教授法の原則を適用し、生成器を尤度最大化と敵対的リアルさの両面で同時に最適化する。
- さらに一般化性能を向上させるために、GANベースの学習とスケジュールドサンプリング(SS)を組み合わせる。この組み合わせは音声品質を劣化させない。
- 二段階の学習目的を用いる:(1) 実際のシーケンスにおける尤度を最大化し、(2) ディスクリミネータの損失を最小化して生成されたシーケンスを実際のものと区別不能にする
実験結果
リサーチクエスチョン
- RQ1生成されたシーケンスを訓練中に組み込むことで、GANを用いた敵対的学習が、自己回帰的TTSモデルにおける露出バイアスを効果的に低減できるか。
- RQ2提案手法のGANベースの学習は、教師強制法やスケジュールドサンプリングと比較して、音声の自然さと聞き取りやすさの面で優れているか。
- RQ3GAN学習とスケジュールドサンプリングを組み合わせることで、モデルの一般化性能が向上し、同時に高い音声品質を維持できるか。
- RQ4提案手法が、長文や複雑な入力シーケンスにおいて、注意機構のアライメントをどれほど安定化させ、誤差蓄積をどれほど低減できるか。
主な発見
- TF-GANモデルは、標準的な教師強制法と比較してCMOSスコアで+0.1の向上を達成し、好まれる割合が5.33%上昇(p=0.02)した。
- TF-GANモデルは、病理的テストセットにおける不明瞭率を11.1%(TF)から4%に低下させ、一般化性能の向上が顕著に見られた。
- スケジュールドサンプリング単体では音声品質が低下した(CMOS -0.04)が、一般化性能は向上した。これは、品質とロバスト性の間でトレードオフがあることを示している。
- SS-GANの組み合わせは、高い音声品質を維持したまま不明瞭率を2.22%に低下させ、品質を損なわせることなく一般化性能を向上させた。
- 長文や複雑な文を含む不良事例の50%以上が、GANベースの学習を適用することで是正された。これは、長文入力に対するロバスト性の向上を示している。
- 実際のデータと生成されたデータの分布の乖離を最小化することで、注意機構のアライメントが安定化し、特に長シーケンスのデコードにおいて誤差伝搬が低減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。