Skip to main content
QUICK REVIEW

[論文レビュー] Fully-hierarchical fine-grained prosody modeling for interpretable speech synthesis

Guangzhi Sun, Yu Zhang|arXiv (Cornell University)|Feb 6, 2020
Speech Recognition and Synthesis参考文献 35被引用数 7
ひとこと要約

本稿では、テキスト音声合成(TTS)におけるプロソディの複数レベル(発話、語、音素)を階層的条件下でモデリングする、完全な階層的条件付き変分オートエンコーダー(VAE)を提案する。この手法により、F0、エネルギー、発話長のプロソディ属性の分離性が向上し、定量的評価では完全な階層的VAEで11.5±2.3の分散比を達成し、ベースラインモデルを上回り、解釈可能で細分化されたプロソディ制御を可能にする。

ABSTRACT

This paper proposes a hierarchical, fine-grained and interpretable latent variable model for prosody based on the Tacotron 2 text-to-speech model. It achieves multi-resolution modeling of prosody by conditioning finer level representations on coarser level ones. Additionally, it imposes hierarchical conditioning across all latent dimensions using a conditional variational auto-encoder (VAE) with an auto-regressive structure. Evaluation of reconstruction performance illustrates that the new structure does not degrade the model while allowing better interpretability. Interpretations of prosody attributes are provided together with the comparison between word-level and phone-level prosody representations. Moreover, both qualitative and quantitative evaluations are used to demonstrate the improvement in the disentanglement of the latent dimensions.

研究の動機と目的

  • 発話、語、音素の複数階層的レベルでプロソディをモデリングすることにより、神経的TTSシステムにおける細分化・解釈可能なプロソディ制御を可能にすること。
  • 既存のVAEベースのプロソディモデリングにおける、潜在表現の混合(エンタングルメント)という課題に取り組むこと。特に、個々の潜在次元が解釈しにくいことに対処すること。
  • 条件付きVAEを用いて、潜在次元間の階層的条件付けを実施することで、F0、エネルギー、発話長といったプロソディ属性の分離性を向上させること。
  • 語レベルでのプロソディ制御が音素レベルの制御よりも自然なプロソディ構造をよりよく保持することを示すことにより、知覚的品質の向上を実証すること。

提案手法

  • Tacotron 2フレームワークに階層的VAEを統合し、発話・語・音素レベルごとに別々の潜在表現を有する。
  • 位置に敏感なアテンションを用いて、ターゲットスペクトログラムと音素レベル表現をアライメントさせ、音素レベルでのプロソディ抽出を可能にする。
  • 自己回帰的構造を持つ条件付きVAEを採用し、より細分化された潜在表現が、粗いレベルの特徴に条件付けられるようにする。
  • 潜在次元にわたる学習順序を一貫させるために、訓練スケジュールを導入する:エネルギー → 発話長 → F0 の順序で学習を実施。
  • 分散比分析を用いて分離性を定量的評価し、1つの潜在次元が1つのプロソディ属性に寄与する割合を測定する。
  • 品質評価のための定性的なMOSテストと定量的分散比分析を併用し、音素レベル対語レベルのサンプリングにおける分離性と知覚的品質を比較する。

実験結果

リサーチクエスチョン

  • RQ1階層的で多次元の潜在変数モデルは、神経的TTSシステムにおけるプロソディ表現の解釈可能性を向上させることができるか?
  • RQ2潜在次元間の階層的条件付けは、F0、エネルギー、発話長といったプロソディ属性の分離性を向上させるか?
  • RQ3語レベルのプロソディ制御は、音素レベルの制御と比較して、知覚的自然さとプロソディック構造の保持の観点で優れているか?
  • RQ4訓練スケジュールは、異なる潜在次元におけるプロソディ属性学習の順序を一貫的かつ解釈可能に制御できるか?
  • RQ5提案された完全な階層的VAEは、ベースラインVAEおよびDIP-VAEに比べ、分離性の質においてどの程度優れているか?

主な発見

  • 完全な階層的VAEは、LibriTTSデータセットで11.5±2.3の分散比を達成し、ベースラインの細分化VAE(7.5±1.0)およびDIP-VAE I(9.9±1.9)を顕著に上回り、プロソディ属性の分離性が優れていることを示している。
  • F0の潜在次元を語レベルで独立してサンプリングした場合のMOSは3.91±0.10であり、音素レベルのサンプリング(3.75±0.09)よりも高い。これは、自然なプロソディ構造の保持がより良好であることを示している。
  • 訓練スケジュールにより、属性学習の順序が一貫してエネルギー → 発話長 → F0 となることが確認され、知覚的および再構成特性と整合的である。
  • 最初の潜在次元が主に無音時間の長さを捉えていることが確認され、モデルが意味的で解釈可能な表現を学習していることが裏付けられた。
  • 再構成性能を維持しつつ、複数のランダムシードおよびデータセットで一貫した分離性の向上が得られたことから、細分化で解釈可能な制御が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。