Skip to main content
QUICK REVIEW

[論文レビュー] StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis

Yinghao Aaron Li, Cong Han|arXiv (Cornell University)|May 30, 2022
Speech Recognition and Synthesis被引用数 16
ひとこと要約

StyleTTSは、参照音声からのAdaINベースのスタイル統合と、新規の移譲可能単調アラインヤー(TMA)を用いたスタイルベースの生成モデルを提案する。このモデルは、明示的なプロソディックラベルなしにゼロショットスタイル転送を可能とし、明示的プロソディックラベルなしにゼロショットスタイル転送を可能とし、非自己回帰的で高速かつ安定した並列推論を実現することで、話者の類似性と話者の自然さの両面で最先端の結果を達成する。

ABSTRACT

Text-to-Speech (TTS) has recently seen great progress in synthesizing high-quality speech owing to the rapid development of parallel TTS systems, but producing speech with naturalistic prosodic variations, speaking styles and emotional tones remains challenging. Moreover, since duration and speech are generated separately, parallel TTS models still have problems finding the best monotonic alignments that are crucial for naturalistic speech synthesis. Here, we propose StyleTTS, a style-based generative model for parallel TTS that can synthesize diverse speech with natural prosody from a reference speech utterance. With novel Transferable Monotonic Aligner (TMA) and duration-invariant data augmentation schemes, our method significantly outperforms state-of-the-art models on both single and multi-speaker datasets in subjective tests of speech naturalness and speaker similarity. Through self-supervised learning of the speaking styles, our model can synthesize speech with the same prosodic and emotional tone as any given reference speech without the need for explicitly labeling these categories.

研究の動機と目的

  • プロソディックおよび感情の変動を伴う、表現的で自然かつ多様な音声を生成するテキスト音声合成システムの課題に取り組む。
  • 既存の並列TTSモデルが単調なアラインメントとスタイルの分離性に課題を抱えるのを克服する。
  • 感情やプロソディックラベルを明示的に与えずに、ゼロショット話者適応およびスタイル転送を可能にする。
  • 転移学習と期間不変のデータ拡張を用いて、アラインメントのロバスト性とプロソディーモデリングを向上させる。
  • 参照音声を用いた適応的インスタンス正規化(AdaIN)による一般化された話し方スタイルの統合を実現し、1対多の音声合成を可能にする。

提案手法

  • 非自己回帰的TTSデータ上で事前学習済みテキストアラインヤーを微調整する移譲可能単調アラインヤー(TMA)を導入し、ハイブリッドソフト・ハードアテンション機構を用いてアラインメント精度を向上させる。
  • モデルの期間予測の不正確さに対してロバストであるようにするため、期間に依存しないデータ拡張戦略を採用し、プロソディーモデリングを強化する。
  • 参照音声から抽出したスタイルベクトルをデコーダーと予測器に条件付けするため、AdaINを用いる。これにより、ピッチ、エネルギー、発話速度を含む豊富なスタイル転送が可能になる。
  • 明示的なラベルなしに、参照音声の感情的・プロソディックなトーンを反映するため、自己教師付きスタイル表現学習を適用する。
  • 2段階の訓練プロセスを採用する:第1段階では、スタイル、ピッチ、エネルギー、音素、アラインメントを用いてメルスペクトログラムの再構築を実行する。第2段階では、テキストからピッチ、エネルギー、アラインメントを一括してエンドツーエンドで予測する。
  • 事前学習済みコンponent(例:テキストアラインヤー、ピッチ抽出器)を活用した転移学習により、小規模なTTSデータセットにおける過学習を軽減する。

実験結果

リサーチクエスチョン

  • RQ1移譲可能単調アラインヤーは、外部アラインヤーに依存せずに、非自己回帰的TTSにおけるアラインメント品質を向上させることができるか?
  • RQ2期間に依存しないデータ拡張は、プロソディーモデリングの向上と期間予測誤差に対するロバスト性を高めるか?
  • RQ3参照音声からのAdaINベースのスタイル統合は、明示的なラベルなしにプロソディックおよび感情的特徴を効果的に転送できるか?
  • RQ4StyleTTSはどの程度、話者や話し方スタイルの多様性を考慮したゼロショット話者適応およびスタイル転送を達成できるか?
  • RQ5残差特徴、正規化タイプ、スタイルの連結といったアーキテクチャ的選択が、音声の自然さとスタイル相関に与える影響はいかほどか?

主な発見

  • TMAは外部アラインヤーを上回る音声品質を実現し、100%ハードアラインメントと比較して+0.26のMOS向上を達成。100%ソフトアテンションでは見られる過学習も回避した。
  • 事前学習済みテキストアラインヤーを削除するとMOSが-0.39低下し、小規模なTTSデータセットにおける過学習低減に有効な転移学習の有効性が示された。
  • 期間に依存しないデータ拡張を導入することでプロソディーモデリングが向上し、その除去により性能低下が顕著に観察された。
  • AdaINを単純な連結やインスタンス正規化に置き換えると、スタイル相関が20%以上低下し、自然さも劣化した。これにより、AdaINがスタイル転送において優位であることが確認された。
  • 識別器を削除すると、音声品質の評価値が著しく低下し、敵対的訓練が音声品質向上において重要であることが示された。
  • 主観評価では、単一話者および複数話者データセットの両方で、ベースラインを上回る高い話者類似性と自然さを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。