[論文レビュー] Controllable and Lossless Non-Autoregressive End-to-End Text-to-Speech
本稿では、48 kHzで高精細な音声合成を実現する非自己回帰型、エンドツーエンドのテキストtoスピーチモデルであるCLONEを提案する。このモデルは、制御可能なプロソディーをサポートしながら、損失なしの高品質な音声合成を可能にする。プロソディーのモデリングには、正規化フローを用いた変分オートエンコーダーを導入し、中間表現の教師付き学習には、真値の音声特徴量を用いたデュアル平行オートエンコーダーを採用することで、自己回帰的生成を一切用いずに、最先端の音声品質と頑健なプロソディー制御を達成した。
Some recent studies have demonstrated the feasibility of single-stage neural text-to-speech, which does not need to generate mel-spectrograms but generates the raw waveforms directly from the text. Single-stage text-to-speech often faces two problems: a) the one-to-many mapping problem due to multiple speech variations and b) insufficiency of high frequency reconstruction due to the lack of supervision of ground-truth acoustic features during training. To solve the a) problem and generate more expressive speech, we propose a novel phoneme-level prosody modeling method based on a variational autoencoder with normalizing flows to model underlying prosodic information in speech. We also use the prosody predictor to support end-to-end expressive speech synthesis. Furthermore, we propose the dual parallel autoencoder to introduce supervision of the ground-truth acoustic features during training to solve the b) problem enabling our model to generate high-quality speech. We compare the synthesis quality with state-of-the-art text-to-speech systems on an internal expressive English dataset. Both qualitative and quantitative evaluations demonstrate the superiority and robustness of our method for lossless speech generation while also showing a strong capability in prosody modeling.
研究の動機と目的
- エンドツーエンドTTSにおける1対多対応問題を解消するため、周波数とエネルギーを越えた一般化されたプロソディック変動をモデル化すること。
- 訓練中に真値の音声特徴量からの監視を導入することで、単一段階TTSにおける高周波数再構成を改善すること。
- 非自己回帰的かつ単一段階のフレームワーク内で、エンドツーエンドで制御可能かつ損失なしの音声合成を実現すること。
- 分離可能で学習可能なプロソディー潜在変数を用いて、表現的な音声合成を可能にすること。
提案手法
- 複雑で高分散性のプロソディック情報を捉えるために、正規化フローを用いた変分オートエンコーダーを用いて、発音子レベルのプロソディー潜在変数をモデル化する。
- プロソディー予測器が入力発音子からプロソディー潜在変数の事前分布を推定することで、エンドツーエンド学習を可能にする。
- デュアル平行オートエンコーダー(DPA)は、音声特徴量用と事後波形用の2つの並列エンコーダーと、共有された波形デコーダーを備え、真値の線形スペクトログラムで学習済み表現を正則化する。
- 収束を加速させ、生成波形の高周波数成分の詳細を向上させるために、マルチバンドディスクライマー(MBD)を導入する。
- ハードアライメントプロソディー抽出器(HAPE)は、ソフトアテンションベースの手法と比較して、プロソディー抽出の精度を向上させる。
実験結果
リサーチクエスチョン
- RQ1非自己回帰的かつ単一段階のTTSモデルは、中間表現に依存せずに、48 kHzでの損失なし音声合成を達成できるか?
- RQ2統一的で暗黙的なプロソディーモデリングアプローチは、周波数とエネルギーを越えた一般化されたプロソディック変動を分離・制御できるか?
- RQ3デュアルオートエンコーダー構造を介して真値の音声特徴量からの監視を導入することで、エンドツーエンドTTSにおける高周波数再構成が顕著に改善されるか?
- RQ4提案手法は、制御可能なプロソディー転送と正確なプロソディー再構成を可能にするか?
主な発見
- CLONEは、内部の表現的英語データセットにおいて最先端の音声品質を達成し、客観的および主観的評価の両方で、SOTAの二段階および単一段階TTSモデルを上回った。
- デュアル平行オートエンコーダー(DPA)は、スペクトログラム比較およびMOS評価を通じて、高周波数の過剰スムージングを効果的に低減し、高周波数成分の詳細を向上させた。
- マルチバンドディスクライマー(MBD)は、モデルの収束を顕著に加速させ、特に高周波数成分において波形品質を向上させた。
- プロソディー転送の実験では、CLONEが参照発話者からターゲット発話者へプロソディーを正確に転送でき、周波数MAEが47.9%低く、エネルギーMAEが11.0%低かった。
- 事後エンコーダーによるプロソディー再構成は高い忠実度を示し、周波数およびエネルギー曲線が参照音声と密接に一致しており、正確なプロソディー抽出を示している。
- ハードアライメントプロソディー抽出器(HAPE)は、ソフトアテンション(SAPE)と比較して、プロソディー抽出のMAEが低く、プロソディー表現学習の精度が向上していることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。