[論文レビュー] Mixture Density Network for Phone-Level Prosody Modelling in Speech Synthesis.
本稿では、テキスト音声合成における発音単位レベルのプロソディモデリングに、ガウス・ミックスチャーモデル(GMM)を用いた混合密度ネットワーク(MDN)を提案する。単一のガウス分布をGMMベースのMDNに置き換えることで、複雑なプロソディ的変動をより効果的に捉えることができ、LJSpeechデータセット上で推論速度に影響を与えずに、プロソディの多様性と音声の自然さが顕著に向上する。
Recent researches on both utterance-level and phone-level prosody modelling successfully improve the voice quality and naturalness in text-to-speech synthesis. However, most of them model the prosody with a unimodal distribution such like a single Gaussian, which is not reasonable enough. In this work, we focus on phone-level prosody modelling where we introduce a Gaussian mixture model(GMM) based mixture density network. Our experiments on the LJSpeech dataset demonstrate that GMM can better model the phone-level prosody than a single Gaussian. The subjective evaluations suggest that our method not only significantly improves the prosody diversity in synthetic speech without the need of manual control, but also achieves a better naturalness. We also find that using the additional mixture density network has only very limited influence on inference speed.
研究の動機と目的
- 単一のガウス分布のような単一モードのプロソディモデリングの限界、特に発話のプロソディに内在するばらつきを捉えられない点を解決すること。
- より柔軟な分布を用いて発音単位レベルのプロソディをモデリングすることで、合成音声の多様性と自然さを向上させること。
- プロソディモデリングをTTSパイプラインに直接統合できる微分可能でエンドツーエンドで学習可能なフレームワークを開発すること。
- 提案されたGMMベースのMDNが、標準モデルと比較して効率的な推論速度を維持しているかどうかを評価すること。
提案手法
- 発音単位の文脈を前提としたプロソディック特徴の条件付き分布をモデリングするために混合密度ネットワーク(MDN)を用いる。
- MDNの標準的な単一ガウス出力を、より多くのモードのプロソディ的変動を捉えるためにガウス・ミックスチャーモデル(GMM)に置き換える。
- GMMの成分(平均、分散、混合重み)を微分可能にパrameter化することで、エンドツーエンド学習を可能にする。
- 発音埋め込みを入力として用い、LJSpeechデータセットで学習し、基本周波数(f0)、エネルギー、発話長などのプロソディック特徴を予測する。
- トレーニング中にGMMサンプリングプロセスを逆伝播可能にするために、再パrameter化技術を適用する。
- 計算オーバーヘッドを最小限に抑えた軽量なGMM埋め込みMDNアーキテクチャを採用することで、推論速度を維持する。
実験結果
リサーチクエスチョン
- RQ1GMMベースの混合密度ネットワークは、単一のガウス分布よりも発音単位レベルのプロソディをより効果的にモデリングできるか?
- RQ2提案手法は、手動制御なしに合成音声のプロソディの多様性と自然さを向上させるか?
- RQ3GMM埋め込みMDNは、標準TTSモデルと比較して推論速度にどのような影響を与えるか?
- RQ4主観評価において、自然さと表現力の観点で、モデルはどのように性能を発揮するか?
主な発見
- GMMベースのMDNは、単一ガウス分布を用いるモデルと比較して、合成音声におけるプロソディの多様性が顕著に向上している。
- 主観評価により、提案手法がベースラインモデルよりも高い自然さスコアを達成していることが確認された。
- 標準MDNベースのTTSシステムとほぼ同等の推論速度を維持しており、計算オーバーヘッドが最小限であることが示された。
- 本手法は、単一モードのモデルが捉えられない複雑なマルチモードのプロソディ的パターンを、発音単位レベルで効果的にモデリングできた。
- 手動によるプロソディ制御の欠如は、データから多様なプロソディ的変動を学習できるモデルの能力によって補われた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。