Skip to main content
QUICK REVIEW

[論文レビュー] Parallel Tacotron 2: A Non-Autoregressive Neural TTS Model with Differentiable Duration Modeling

Isaac Elias, Heiga Zen|arXiv (Cornell University)|Mar 26, 2021
Speech Recognition and Synthesis参考文献 28被引用数 11
ひとこと要約

Parallel Tacotron 2 は、教師付きの持続時間信号を必要とせず、微分可能持続時間モデルと学習可能なアップサンプリング機構に加え補助注意機構を用いて、トークンからフレームへのアライメントと持続時間をエンドツーエンドで学習する非自己回帰的神経音声合成モデルである。主観評価において最先端の自然さを達成し、Tacotron 2 や Parallel Tacotron よりも好みのテストで優れている一方で、発話速度やリズムの制御が可能である。

ABSTRACT

This paper introduces Parallel Tacotron 2, a non-autoregressive neural text-to-speech model with a fully differentiable duration model which does not require supervised duration signals. The duration model is based on a novel attention mechanism and an iterative reconstruction loss based on Soft Dynamic Time Warping, this model can learn token-frame alignments as well as token durations automatically. Experimental results show that Parallel Tacotron 2 outperforms baselines in subjective naturalness in several diverse multi speaker evaluations. Its duration control capability is also demonstrated.

研究の動機と目的

  • 自己回帰的TTSモデルの限界、例えば推論が遅いこと、過剰生成・不足生成といったロバストネスの問題を解決する。
  • 非自己回帰的TTSにおける外部アライナーや教師付き持続時間信号への依存を排除することで、訓練の複雑さを軽減し、モデルのロバストネスを向上させる。
  • 持続時間予測とアライメント学習のエンドツーエンド微分可能訓練を可能とし、持続時間予測およびアップサンプリングを経由した勾配の流れを実現する。
  • 再帰層を排除して並列生成を可能とすることで、現代のアクセラレータ上で推論速度と効率を向上させる。
  • 学習可能な微分可能持続時間モデリングとアップサンプリングを用いて、発話のリズムと速度に対する細かい制御を可能にする。

提案手法

  • 連続的な持続時間を予測し、丸め操作を経由しても勾配がバックプロパゲート可能となる完全に微分可能な持続時間モデルを導入する。
  • 真値の持続時間に依存せず、補助的文脈を用いた新しい注意機構を採用し、トークンからフレームへのアライメントを学習する。
  • 予測された持続時間とトークン表現から得られる文脈を基に、ドット積注意に基づく学習可能なアップサンプリング機構を採用する。
  • 長さマッチングの教師信号を必要とせず、予測されたメルスペクトログラムとターゲットメルスペクトログラムのアライメントをSoft Dynamic Time Warping (Soft-DTW) を用いた反復的再構成損失で行う。
  • 教師強制をSoft-DTWに置き換えることで、訓練中に長さの不一致に対処し、訓練の安定性とアライメントの正確性を向上させる。
  • 持続時間モデルとアップサンプリング機構を非自己回帰的TTSフレームワークに統合し、並列生成と高速な推論を実現する。

実験結果

リサーチクエスチョン

  • RQ1教師付き持続時間信号や外部アライナーに依存せずに、非自己回帰的TTSモデルが正確なトークンからフレームへのアライメントと持続時間を学習できるか?
  • RQ2従来の非微分可能丸め処理と比較して、完全に微分可能な持続時間予測機構がアライメント品質とモデル性能を向上させるか?
  • RQ3Soft-DTWに基づく再構成損失は、長さマッチングの教師信号を必要とせず、訓練中に長さの不一致を効果的に処理できるか?
  • RQ4学習された持続時間の操作によって、発話速度やリズムの制御がどの程度可能になるか?
  • RQ5提案されたアーキテクチャは、自己回帰的および従来の非自己回帰的TTSベースラインと比較して、より自然な音声と高速な推論を達成できるか?

主な発見

  • Parallel Tacotron 2 は主観評価でMOS 4.40 ± 0.05を達成し、Tacotron 2 と同等のスコアを記録したが、好みテストでは0.19 ± 0.09のスコアで優れていた。
  • Rapid評価セットでは、Parallel Tacotron 2 はTacotron 2 よりも0.69 ± 0.16の好みスコアを記録し、顕著に高い自然さが評価された。
  • ホールドアウトセットでは、Parallel Tacotron 2 は人間の自然な発話よりも高く評価され、好みスコア0.01 ± 0.09を記録した。これは、人間と同等またはそれを上回る知覚的品質を示している。
  • モデルは効果的な持続時間制御を示した。グローバルなスピードスケーリング(0.75× から 1.25×)と単語単位の持続時間スケーリング(0.5× から 1.5×)が、整合的かつ制御可能な発話を生成した。
  • 主観評価により、合成音声のプロソディがベースラインと比較して顕著に自然であることが確認された。特に、再構成プロンプトが使用されたRapidセットにおいて顕著であった。
  • 再帰層を排除し、並列生成を可能としたことで、自己回帰的Tacotron 2 よりも高速な推論を達成したが、正確な速度メトリクスは報告されていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。