Skip to main content
QUICK REVIEW

[論文レビュー] Semi-Supervised Generative Modeling for Controllable Speech Synthesis

Raza Habib, Soroosh Mariooryad|arXiv (Cornell University)|Oct 3, 2019
Speech Recognition and Synthesis参考文献 36被引用数 15
ひとこと要約

この論文は、ニューラルTTSと変分オートエンコーダーを統合した半教師付きの深層生成モデルを提案し、信頼性があり制御可能な音声合成を実現する。最小限の教師付きデータ(1%または30分間のラベル付きデータ)を潜在的プロソディ変数に適用することで、感情、発話速度、F0変動といった解釈可能な属性を分離・制御可能となり、合成品質に悪影響を及げることなく、固定された制御要因を用いた一貫したサンプリングが可能となる。

ABSTRACT

We present a novel generative model that combines state-of-the-art neural text-to-speech (TTS) with semi-supervised probabilistic latent variable models. By providing partial supervision to some of the latent variables, we are able to force them to take on consistent and interpretable purposes, which previously hasn't been possible with purely unsupervised TTS models. We demonstrate that our model is able to reliably discover and control important but rarely labelled attributes of speech, such as affect and speaking rate, with as little as 1% (30 minutes) supervision. Even at such low supervision levels we do not observe a degradation of synthesis quality compared to a state-of-the-art baseline. Audio samples are available on the web.

研究の動機と目的

  • 音声合成における高レベルのプロソディック属性(感情、発話速度など)を制御する課題に取り組むこと。これらはスケールアップしてラベルづけすることが困難である。
  • 純粋に教師なしの潜在変数モデルが示す非同定性(non-identifiability)と解釈性の低さを克服すること。これらは、学習された要因に意味を割り当てるために多数の後処理を要する。
  • 最小限の人的ラベル付きデータ(1%程度)を用いても、信頼性があり分離可能なプロソディック属性の制御を実現すること。
  • 制御性を導入しても、最先端の完全教師ありベースラインと比較して品質が低下しない、高品質な音声合成を維持すること。
  • ラベルなしの未学習の話者に対しても、制御性をドメイン転送可能にすること。ラベルなしデータを用いても、学習済みデータを超えた制御性の拡張が可能となる。

提案手法

  • モデルは条件付き変分オートエンコーダー(VAE)フレームワークを用い、音声特徴 $x$ をテキスト $y$ から条件付きに生成する。2つの潜在変数を用いる:$z_s$(半教師ありで制御可能なプロソディック要因)と $z_u$(完全に観測されない、制御されないプロソディック変動をモデル化)。
  • 尤度 $p(x|y, z_u, z_s)$ は、Tacotron 2 に類似したアテンション付きのシーケンス・ツー・シーケンスニューラルネットワークでパラメータライズされ、メルスペクトログ램フレームの自己回帰的で等方的(isotropic)なラプラス分布の平均を出力する。
  • 半教師あり学習は、確率的勾配変分ベイズ(SGVB)を用いて実施。教師付きデータポイントの事後分布は、真値ラベルに条件づけられた変分分布でモデル化されるが、非教師付きポイントは標準的な事後分布近似を用いる。
  • 連続的 $z_s$ に対しては標準正規分布を、離散的 $z_s$ に対しては一様カテゴリカル事前分布を用いることで、連続的および離散的両方の制御可能な要因を可能にする。
  • 制御は、デコーダーを $z_s$ に条件づけることで達成され、$z_s$ を固定したまま多様なプロソディック変動のサンプリングが可能となり、分離可能な制御が実現される。
  • モデルは変分下界(ELBO)に基づくエンド・ツー・エンドの学習を経て、推論はサンプリング時に事後分布近似を用いて実施される。

実験結果

リサーチクエスチョン

  • RQ1半教師ありの潜在変数モデリングは、感情や発話速度といったプロソディック属性に対して、信頼性があり解釈可能な制御を可能にするか?
  • RQ2生成的TTSフレームワークにおいて、プロソディック要因の一貫した分離と制御を達成するために、どの程度の最小限の監視が必要か?
  • RQ3最小限のラベル付けであっても、制御性を導入した際に、合成品質が維持されるか?
  • RQ4訓練時に見られなかった話者に対しても、制御性をドメイン転送可能か?ラベルなしデータで制御性を拡張できるか?
  • RQ5確率的定式化により、ヒューリスティック手法とは異なり、特定の制御要因を固定したまま多様なプロソディック変動のサンプリングが可能か?

主な発見

  • モデルは、学習データの1%(約30分間の音声)のラベル付きデータのみで、感情、発話速度、F0変動の制御を信頼性を持って達成した。
  • クラウドソーシングによる平均意見スコア(MOS)で確認されたように、合成品質は最先端の完全教師ありTTSシステムと同等であり、最小限の監視にもかかわらず品質の低下は観察されなかった。
  • 特定の制御要因を固定したまま、多様なプロソディック変動(例:異なる感情的トーンや発話速度)のサンプリングが可能であり、分離可能な生成が実証された。
  • ラベルなしの未学習話者に対しても、制御性が成功裏にドメイン転送され、ラベルなしデータを用いた強力なドメイン転送能力が示された。
  • 本手法は連続的および離散的両方の制御可能な要因をサポートし、学習分布外の範囲(例:極端な感情的強度)への外挿も可能である。
  • 半教師ありアプローチにより、完全に教師なしモデルの非同定性と解釈性の低さの問題が解決され、学習された潜在要因に意味を割り当てるための複雑な後処理の必要がなくなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。