Skip to main content
QUICK REVIEW

[論文レビュー] WaveTTS: Tacotron-based TTS with Joint Time-Frequency Domain Loss

Rui Liu, Berrak Şişman|arXiv (Cornell University)|Feb 2, 2020
Speech Recognition and Synthesis参考文献 44被引用数 4
ひとこと要約

WaveTTSは、時間領域波形品質と周波数領域音響特徴の両方を同時に最適化する、新しいタコトロンベースの音声合成フレームワークを提案する。二重損失関数を用い、時間領域損失(SI-SDR)と標準的なメルスペクトログ램損失を併用する。この共同学習により、MOSスコアと好みテストの両面でベースラインを上回る音声品質が実現され、タコトロンベースTTSにおけるこのようなアプローチの初の実装である。

ABSTRACT

Tacotron-based text-to-speech (TTS) systems directly synthesize speech from text input. Such frameworks typically consist of a feature prediction network that maps character sequences to frequency-domain acoustic features, followed by a waveform reconstruction algorithm or a neural vocoder that generates the time-domain waveform from acoustic features. As the loss function is usually calculated only for frequency-domain acoustic features, that doesn't directly control the quality of the generated time-domain waveform. To address this problem, we propose a new training scheme for Tacotron-based TTS, referred to as WaveTTS, that has 2 loss functions: 1) time-domain loss, denoted as the waveform loss, that measures the distortion between the natural and generated waveform; and 2) frequency-domain loss, that measures the Mel-scale acoustic feature loss between the natural and generated acoustic features. WaveTTS ensures both the quality of the acoustic features and the resulting speech waveform. To our best knowledge, this is the first implementation of Tacotron with joint time-frequency domain loss. Experimental results show that the proposed framework outperforms the baselines and achieves high-quality synthesized speech.

研究の動機と目的

  • タコトロンベースTTSにおける周波数領域損失最適化と実際の時間領域波形品質との不一致を解消すること。
  • 訓練中に時間領域波形を直接監視することで、音声合成品質を向上させること。
  • 時間領域損失と周波数領域損失を一つの訓練目的に組み合わせた有効性を調査すること。
  • 非ニューラル音声生成器(例:Griffin-Lim)を推論時に使用しても、共同最適化が性能向上に寄与することを示すこと。
  • 異なる音声生成器に対して一般化性と耐性を高める新しいタコトロン訓練パラダイムを確立すること。

提案手法

  • 周波数領域損失(メルスペクトログラム損失)と時間領域損失(SI-SDR)の両方をモデル最適化中に適用する共同学習スキームを導入する。
  • 予測されたメルスペクトログ램から時間領域波形を生成するために、反復的位相再構成を伴うGriffin-Limを用い、時間領域損失の計算に使用する。
  • スケール不変信号対歪み比(SI-SDR)を用いて時間領域損失を計算し、振幅および位相の不一致に対してロバストであるようにする。
  • 両方の損失関数を用いて特徴予測ネットワークをエンドツーエンドで訓練し、高品質な波形を生成する特徴を学習可能にする。
  • 推論時の音声生成器(Griffin-LimまたはWaveNet)に関わらず、同じ共同損失を訓練中に適用することで、一貫性のある最適化を実現する。
  • エンコーダ、アテンションベースのデコーダ、ポストネットを備えた標準的なタコトロンアーキテクチャを採用するが、波形レベルの監視を可能にするために損失関数を変更する。

実験結果

リサーチクエスチョン

  • RQ1時間領域と周波数領域の両方を共同で最適化することで、タコトロンベースTTSにおける合成音声の知覚的品質が向上するか?
  • RQ2Griffin-Limなどの決定的音声生成器を用いても、訓練時に時間領域損失関数を組み込むことで波形アーティファクトが低減され、自然さが向上するか?
  • RQ3推論時の音声生成器をGriffin-LimからWaveNetなどのニューラル音声生成器に変更した場合、提案された共同損失はどのように性能を示すか?
  • RQ4Griffin-Limの反復回数が時間領域損失および最終的な音声品質に与える影響は何か?
  • RQ5再トレーニングなしに、共同損失で学習したモデルが異なる音声生成器間で一般化できるか?

主な発見

  • WaveTTS-GLは平均意見スコア(MOS)3.30を達成し、3.18を記録したTacotron-GLを顕著に上回った。
  • WaveTTS-WNは推論時にWaveNet音声生成器を用いた場合、Tacotron-WNを上回った。これは、ニューラル音声生成器を用いても共同学習の恩恵が得られることを示している。
  • 好みテストでは、A/B比較の72%においてWaveTTS-GLがTacotron-GLよりも好まれ、95%信頼区間が得られた。
  • WaveTTS-WNはTacotron-WNよりも高い好みスコアを記録し、共同学習による一般化の利点を確認した。
  • A/Bテストの結果、Griffin-Limの1反復が2反復よりも優れた音声品質を示した。これは、訓練時の波形再構成における最適なトレードオフが得られていることを示唆している。
  • 提案された共同損失フレームワークは、推論時の音声生成器に依存せず有効であるため、異なる波形生成手法に対して耐性があり、一般化性が高いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。