[論文レビュー] Sampling-based speech parameter generation using moment-matching networks
本論文では、DNNベースの音声合成における自然な発話間のばらつきを導入するため、モーメントマッチングネットワークを用いたサンプリングベースの音声パラメータ生成手法を提案する。最大平均差分(MMD)を用いて自然音声パラメータの統計的モーメントを一致させることで、深層ニューラルネットワークを訓練し、低次元のノイズベクトルを用いて多様な音声出力を生成する。最大尤度法と比較して品質が劣化しない高品質な合成を達成する。
This paper presents sampling-based speech parameter generation using moment-matching networks for Deep Neural Network (DNN)-based speech synthesis. Although people never produce exactly the same speech even if we try to express the same linguistic and para-linguistic information, typical statistical speech synthesis produces completely the same speech, i.e., there is no inter-utterance variation in synthetic speech. To give synthetic speech natural inter-utterance variation, this paper builds DNN acoustic models that make it possible to randomly sample speech parameters. The DNNs are trained so that they make the moments of generated speech parameters close to those of natural speech parameters. Since the variation of speech parameters is compressed into a low-dimensional simple prior noise vector, our algorithm has lower computation cost than direct sampling of speech parameters. As the first step towards generating synthetic speech that has natural inter-utterance variation, this paper investigates whether or not the proposed sampling-based generation deteriorates synthetic speech quality. In evaluation, we compare speech quality of conventional maximum likelihood-based generation and proposed sampling-based generation. The result demonstrates the proposed generation causes no degradation in speech quality.
研究の動機と目的
- 従来のDNNベースの音声合成では、同じ入力コンテキストに対して同一の出力を生成するため、発話間のばらつきが欠如しているという問題に対処すること。
- 自然な人間の可変性を反映する多様な音声パラメータを、計算コスト効率の良い方法で生成すること。
- モーメントマッチングネットワークを用いたサンプリングベースの生成が、最大尤度ベースの合成と比較して音声品質を劣化させるかどうかを評価すること。
- 音声パラメータの複雑な非パラメトリック分布をモデル化することで、現実的で自然なばらつきを有するエンドツーエンドの音声合成を可能にすること。
提案手法
- 条件付き最大平均差分(MMD)を用いて訓練されたモーメントマッチングネットワークを用い、生成された音声パラメータのモーメントを自然音声のそれと一致させる。
- 発話のばらつきを注入するために、低次元の等方的ガウスノイズベクトルを事前分布として用いる。
- DNNはノイズベクトルを音声パラメータにマップし、生成されたパラメータの統計的分布が自然音声のそれと一致するようにするが、特定のパラメトリック形式を仮定しない。
- 訓練目的は、ガウスカーネル関数を用いて、自然音声と生成音声のパラメータの経験的分布間のMMDを最小化することである。
- 同じ入力コンテキストに対して異なるノイズベクトルを用いてDNN出力をサンプリングすることで、音声パラメータを合成し、多様な出力を実現する。
- モデルはWORLDから抽出した特徴(メル倒頻スペクトル係数、F0、バンドアパーチャリティ)、入力特徴として言語的特徴およびスプーカーコード、ボトルネック表現を用いて訓練される。
実験結果
リサーチクエスチョン
- RQ1モーメントマッチングネットワークを用いたサンプリングベースの音声パラメータ生成は、発話間のばらつきを導入しつつ、音声品質を維持できるか?
- RQ2ばらつきを導入した場合に、提案手法が従来の最大尤度ベースの合成よりも音声品質で優れているか?
- RQ3提案されたサンプリング手法の計算コストは、高次元の音声パラメータ分布からの直接サンプリングよりも低いか?
- RQ4明示的な密度推定を伴わずに、モーメントマッチングネットワークが複雑な非ガウス分布を効果的にモデル化できるか?
主な発見
- 好みのABテストでは、サンプリングベースの生成が最大尤度ベースの合成と比較して、音声品質に顕著な劣化が認められなかった。
- 本手法は、パラメータ生成に等方的ガウス分布を仮定する従来のDNNベースの合成よりも優れた音声品質を達成した。
- 低次元のノイズベクトルを用いた音声パラメータのばらつき表現により、計算コストを増加させることなく、効率的かつスケーラブルなサンプリングが可能になった。
- モーメントマッチングの訓練基準は、全共分散や混合分布の明示的モデル化を伴わず、音声パラメータの複雑な統計的依存関係を効果的に捉え、現実的で自然なばらつきを可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。