[論文レビュー] EfficientTTS: An Efficient and High-Quality Text-to-Speech Architecture
EfficientTTSは、インデックスマッピングベクトルを用いた新しいモノトニックアライメントモデリング手法を採用した非自己回帰的音声合成アーキテクチャを提案する。この手法により、外部アライナーを必要とせず、安定的かつ効率的な学習と推論が可能となり、Tacotron 2 や Glow-TTS よりも音声品質、学習効率、合成速度で優れた性能を達成する。
In this work, we address the Text-to-Speech (TTS) task by proposing a non-autoregressive architecture called EfficientTTS. Unlike the dominant non-autoregressive TTS models, which are trained with the need of external aligners, EfficientTTS optimizes all its parameters with a stable, end-to-end training procedure, while allowing for synthesizing high quality speech in a fast and efficient manner. EfficientTTS is motivated by a new monotonic alignment modeling approach (also introduced in this work), which specifies monotonic constraints to the sequence alignment with almost no increase of computation. By combining EfficientTTS with different feed-forward network structures, we develop a family of TTS models, including both text-to-melspectrogram and text-to-waveform networks. We experimentally show that the proposed models significantly outperform counterpart models such as Tacotron 2 and Glow-TTS in terms of speech quality, training efficiency and synthesis speed, while still producing the speeches of strong robustness and great diversity. In addition, we demonstrate that proposed approach can be easily extended to autoregressive models such as Tacotron 2.
研究の動機と目的
- 外部アライナーに依存する非自己回帰的TTSモデルにおける学習の不安定性と非効率性の課題に取り組む。
- 音声品質を損なわせることなく、高速な学習と推論を実現する完全なエンドツーエンドの非自己回帰的TTSフレームワークを構築する。
- 計算コストを最小限に抑えた新たなモノトニックアライメントモデリング技術を導入し、アライメント精度とモデルの安定性を向上させる。
- テキストからメルスペクトログ램への変換およびテキストから波形への変換を含む、複数のTTSバリアントに対して提案アーキテクチャの有効性を実証する。
- 提案されたモノトニックアライメント手法が、Tacotron 2 のような自己回帰的モデルに対しても拡張可能であり、そのロバスト性と性能向上に寄与することを示す。
提案手法
- 計算量の増加を伴わずに注意機構におけるモノトニック性を強制するインデックスマッピングベクトル(IMV)を用いたモノトニックアライメントモデリング手法を提案する。
- IMVに基づく注意機構を、並列シーケンス生成が可能な完全な畳み込み型非自己回帰エンコーダデコーダフレームワークに統合する。
- 外部アライナーまたは後処理によるアライメント抽出を不要とする、単一のネットワークを用いたエンドツーエンド学習を実施する。
- EFTS-CNN(畳み込み型)、EFTS-Flow(ノーマライジングフロー型)、EFTS-Wav(エンドツーエンド波形生成)の3つのモデルアーキテクチャを含むモデルファミリーを設計する。
- IMVを用いてハードおよびソフトなモノトニックアライメントを生成し、ハードアライメント(HMA)がより顕著な性能向上をもたらすことを確認する。
- EFTS-Flowにおける潜在変数の温度調整、アライメント方式の変更、アラインド位置のスケーリングを制御することで、推論段階での音声の多様性を制御可能にする。
実験結果
リサーチクエスチョン
- RQ1外部アライナーに依存しない非自己回帰的TTSモデルは、高品質な音声合成と高い学習効率を達成できるか?
- RQ2インデックスマッピングベクトルを用いた提案されたモノトニックアライメントモデリング手法は、学習の安定性と推論品質の向上にどの程度効果的か?
- RQ3モノトニックアライメントアプローチは、難しいテキスト入力に対してもTTSモデルのロバスト性をどの程度向上できるか?
- RQ4提案されたアーキテクチャは、Tacotron 2 のような自己回帰的モデルへも拡張可能で、その性能向上に寄与するか?
- RQ5スタイルやスプーカーエンベッディングを用いた従来手法と比較して、本モデルの多様な音声サンプル生成能力はどの程度優れているか?
主な発見
- EFTS-HMAは270kステップで学習損失0.095を達成し、EFTS-SMA(450kステップで0.33)およびEFTS-NM(収束せず)を著しく上回る。
- EFTS-CNNは、タコトロン2(13回の繰り返し、7回のスキップ、5回の誤発音、50%のエラー率)と比較して、耐性エラーを大幅に低減(0回の繰り返し、0回のスキップ、2回の誤発音)。
- 提案されたモノトニックアライメント手法により、タコトロン2のエラー率は50%から8%に低下し、ロバスト性が向上したことが示された。
- EFTS-HMAは、EFTS-SMA やベースラインモデルと比較して、アライメント精度に劣化を来さずに高速な推論速度と優れた音声品質を達成した。
- EFTS-Flowは、潜在変数の温度調整により、同じテキストから多様な音声を生成可能な制御可能な音声変異を実現した。
- EFTS-Wav を含むモデルファミリーは、高品質かつ効率的なエンドツーエンドのテキストから波形への変換を実現し、アーキテクチャのスケーラビリティを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。