Skip to main content
QUICK REVIEW

[論文レビュー] AlignTTS: Efficient Feed-Forward Text-to-Speech System without Explicit Alignment

Zhen Zeng, Jianzong Wang|arXiv (Cornell University)|Mar 4, 2020
Speech Recognition and Synthesis参考文献 27被引用数 4
ひとこと要約

AlignTTS は、自己回帰的教師モデルに依存せずに最先端の性能を達成する非自己回帰的、フィードフォワード型のトランスフォーマー基盤の音声合成システムを提案する。バウム=ウェルチアルゴリズムにインspiredされた新しいアライメント損失を導入することで、学習中に正確なテキストからメルスペクトルへのアライメントを学習し、並列推論を可能にした。これにより、リアルタイム比50倍以上の高速化が達成され、トランスフォーマーTTSよりMOSが0.03向上した。

ABSTRACT

Targeting at both high efficiency and performance, we propose AlignTTS to predict the mel-spectrum in parallel. AlignTTS is based on a Feed-Forward Transformer which generates mel-spectrum from a sequence of characters, and the duration of each character is determined by a duration predictor.Instead of adopting the attention mechanism in Transformer TTS to align text to mel-spectrum, the alignment loss is presented to consider all possible alignments in training by use of dynamic programming. Experiments on the LJSpeech dataset show that our model achieves not only state-of-the-art performance which outperforms Transformer TTS by 0.03 in mean option score (MOS), but also a high efficiency which is more than 50 times faster than real-time.

研究の動機と目的

  • 自己回帰的教師モデルに依存しない高効率な非自己回帰的音声合成システムの開発。
  • 明示的なアテンション機構を用いずに、テキストとメルスペクトルの間のアライメント学習を改善すること。
  • リアルタイム推論速度を実現しながら、最先端の音声品質を達成すること。
  • すべての可能なアライメントを考慮する訓練目的関数の設計により、ロバスト性と正確性の向上。

提案手法

  • モデルはスタックされたFFTブロック、自己アテンション、1次元畳み込みを備えたフィードフォワード型トランスフォーマー(FFT)を用い、並列にメルスペクトログラムを生成する。
  • デュレーション予測器が各文字の発音時間の推定値を算出し、長さレギュレータが推論時にテキストとメルスペクトルをアライメントする。
  • バウム=ウェルチアルゴリズムにインspiredされたアライメント損失を導入し、バックプロパゲーション時にすべての可能なアライメントを考慮してモデルを訓練する。
  • 条件付きメルスペクトログラム分布をモデル化するためにミックス密度ネットワークを用い、アライメント学習を改善する。
  • 再構成損失、デュレーション損失、アライメント損失の組み合わせを用いて、エンドツーエンドでモデルを訓練する。
  • 予測されたメルスペクトログラムから波形を合成するために、並列型ニューラルコーディネート WaveGlow を使用する。

実験結果

リサーチクエスチョン

  • RQ1自己回帰的教師モデルによるアライメントガイドを用いずに、非自己回帰的TTSシステムが最先端の性能を達成できるか?
  • RQ2すべての可能なアライメントを考慮する微分可能なアライメント損失が、アライメントの正確性と合成品質を向上させられるか?
  • RQ3フィードフォワード型トランスフォーマー・アーキテクチャが、高品質な音声を維持しつつ高速推論を可能にできるか?
  • RQ4提案されたアライメント損失は、アテンションベースのアライメントと比較して、正確性とロバスト性において優れているか?

主な発見

  • LJSpeechデータセットにおいて、AlignTTSは平均評価スコア(MOS)4.05±0.12を達成し、トランスフォーマーTTSより0.03MOS高い性能を示した。
  • モデルは約10秒分の音声を0.18秒で合成し、リアルタイム比50倍以上の高速化を達成した。
  • アライメント損失により、図3の視覚的確認でも示されるように、トランスフォーマーTTSのアテンション機構よりもテキストとメルスペクトルの間でより正確なアライメントが実現された。
  • AlignTTSの推論速度は10秒分の音声あたり0.18秒で、TTSモデルに0.06秒、WaveGlow音声生成器に0.12秒を要した。
  • Tacotron2(4.58秒)やトランスフォーマーTTS(3.26秒)といった自己回帰的モデルと比較して、顕著な高速化を達成しながらも、より高い品質を維持した。
  • デュレーション予測器と長さレギュレータのおかげで、発話速度や間の制御が可能となり、推論時にプロソディック制御が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。