Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Generative Modeling for Controllable Speech Synthesis

Wei-Ning Hsu, Yu Zhang|arXiv (Cornell University)|Oct 16, 2018
Speech Recognition and Synthesis参考文献 26被引用数 45
ひとこと要約

本論文は GMVAE-Tacotron を提案します。これは、2 レベルの階層潜在変数(離散の y_l と連続の z_l)を持つニューラル TTS モデルで、VAE フレームワーク内でガウス混合分布を事前分布として用い、話者・スタイル・ノイズ属性にわたって制御可能に音声を合成します。

ABSTRACT

This paper proposes a neural sequence-to-sequence text-to-speech (TTS) model which can control latent attributes in the generated speech that are rarely annotated in the training data, such as speaking style, accent, background noise, and recording conditions. The model is formulated as a conditional generative model based on the variational autoencoder (VAE) framework, with two levels of hierarchical latent variables. The first level is a categorical variable, which represents attribute groups (e.g. clean/noisy) and provides interpretability. The second level, conditioned on the first, is a multivariate Gaussian variable, which characterizes specific attribute configurations (e.g. noise level, speaking rate) and enables disentangled fine-grained control over these attributes. This amounts to using a Gaussian mixture model (GMM) for the latent distribution. Extensive evaluation demonstrates its ability to control the aforementioned attributes. In particular, we train a high-quality controllable TTS model on real found data, which is capable of inferring speaker and style attributes from a noisy utterance and use it to synthesize clean speech with controllable speaking style.

研究の動機と目的

  • データで Rarely annotated な属性(話し方、アクセント、バックグラウンドノイズ、収録条件)に対する可制御 TTS を動機づける。
  • ラベル付き話者属性をラベルなし潜在属性から分離する階層型 variational autoencoder ベースのモデルを提案する。
  • 解釈可能な潜在クラスタの学習と、多様で制御可能な音声を得るサンプリング機構を実証する。
  • 実世界の録音条件が異なるデータと未知の話者での有効性を示す。

提案手法

  • Gaussian mixture でモデル化された 2 レベルの潜在変数を含む Tacotron 2 を拡張する。
  • p(y_l) を一様分布 prior とし、p(z_l|y_l) を対角ガウスとして潜在空間に GMN の prior を形成する。
  • VAE フレームワーク内で encoder ネットワークを通じて後方分布 q(z_l|X) および q(y_l|X) を推定し、ELBO を最適化する。
  • 観測されたラベルに結びつくクラス内のばらつきを捉えるため、観測属性表現 z_o を導入する。
  • synthesizer を z_l、z_o、y_o(利用可能な場合)で条件付けし、潜在属性の分離制御を実現する。
  • 効率的な学習と高品質な出力のため WaveRNN ボコーダを用いた Tacotron-2 ベースのシンセサイザを採用する。

実験結果

リサーチクエスチョン

  • RQ12 レベルの潜在空間(離散の y_l と連続の z_l)が、スタイル、ノイズ、プロソディなどの潜在音声属性を捉え、分離できるか。
  • RQ2ガウス混合 prior が潜在属性の解釈可能なクラスタリングと多様な音声合成の堅牢なサンプリングを促進するか。
  • RQ3ノイズがあるまたは未知の話者から話者に依存しない潜在属性を学習し、なおかつ高品質でクリーンな音声を生成できるか。
  • RQ4GMVAE-Tacotron は自然さと SNR において GST、VAE、基準 Tacotron-2 と比較してどうか。
  • RQ5話し方のスタイルとノイズ属性を独立してサンプル・制御しつつ、話者アイデンティティを維持できるか。

主な発見

  • GMVAE-Tacotron は清音/ノイズ条件、話者特性などの属性に対応する解釈可能な潜在クラスタを実現する。
  • 話者、ノイズ、スタイル属性の分離制御を示し、それぞれの要因を独立して操作できる。
  • ノイズの多い多話者コーパスで、GMVAE はノイズのあるトレーニングデータを持つ話者に対してクリーンな音声を合成し、ベースラインより MOS や SNR が高い。
  • 連続潜在空間は、属性を制御したサンプリングを可能にし、多様で自然な韻律と話し方をもたらす。
  • 実験は、混合成分が話者グループ(例: アクセント、性別)と高い一貫性をもち、F0 や速度などの属性をディメンショニングできることを示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。