Skip to main content
QUICK REVIEW

[論文レビュー] A Spectral Energy Distance for Parallel Speech Synthesis

Alexey A. Gritsenko, Tim Salimans|arXiv (Cornell University)|Aug 3, 2020
Speech and Audio Processing参考文献 36被引用数 20
ひとこと要約

本論文は、解析的尤度関数が不要で敵対的学習を必要としない、並列で非自己回帰的音声合成モデルを訓練するためのスペクトルエネルギー距離(SED)損失を提案する。生成サンプル間の反発項を組み込むことで、SEDは統計的整合性を保証する適切なスコアルールとして機能し、安定的かつ高速な学習を可能にし、implicitな生成モデルにおける最先端の品質を達成する。さらに、GANと組み合わせることで性能が向上する。

ABSTRACT

Speech synthesis is an important practical generative modeling problem that has seen great progress over the last few years, with likelihood-based autoregressive neural models now outperforming traditional concatenative systems. A downside of such autoregressive models is that they require executing tens of thousands of sequential operations per second of generated audio, making them ill-suited for deployment on specialized deep learning hardware. Here, we propose a new learning method that allows us to train highly parallel models of speech, without requiring access to an analytical likelihood function. Our approach is based on a generalized energy distance between the distributions of the generated and real audio. This spectral energy distance is a proper scoring rule with respect to the distribution over magnitude-spectrograms of the generated waveform audio and offers statistical consistency guarantees. The distance can be calculated from minibatches without bias, and does not involve adversarial learning, yielding a stable and consistent method for training implicit generative models. Empirically, we achieve state-of-the-art generation quality among implicit generative models, as judged by the recently-proposed cFDSD metric. When combining our method with adversarial techniques, we also improve upon the recently-proposed GAN-TTS model in terms of Mean Opinion Score as judged by trained human evaluators.

研究の動機と目的

  • 1秒あたりの音声を処理するのに数万回の逐次ステップを必要とする自己回帰的音声合成モデルの非効率性を是正すること。
  • 解析的尤度関数へのアクセスが不要な、implicitな音声生成モデルの安定的で敵対的でない学習手法の開発。
  • スペクトログラム分布に基づく適切なスコアルールを用いて、並列音声合成におけるサンプルの多様性と生成品質の向上。
  • 効率的なネットワークアーキテクチャと敵対的学習を組み合わせることで、より高速かつ高品質な音声生成を実現すること。

提案手法

  • 本手法は、生成された音声波形と実際の音声波形のマグニチュードスペクトログラムに作用する一般化エネルギー距離(GED)を導入する。
  • スペクトルエネルギー距離には、生成サンプル間の反発項が含まれており、多様性を促進し、統計的整合性を保証する。
  • バイアスのないミニバッチからの損失計算により、効率的かつ安定的な最適化が可能である。
  • 追加の反発項を含む多解像度スペクトログラム損失を用いて、非自己回帰モデルの学習に本手法を適用する。
  • より高速な推論を実現するための効率的なオーバーラップアドアップサンプリングモジュールを提案し、さらに性能向上のためGANベースの学習と組み合わせる。
  • 人間評価者によるcFDSD指標と平均意見スコア(MOS)を用いて、本手法の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1尤度フリーな学習目的関数を設計でき、並列音声合成において統計的整合性と安定的収束を保証できるか?
  • RQ2生成サンプル間の反発項を組み込むことで、implicitな生成モデルにおけるサンプルの多様性と生成品質が向上するか?
  • RQ3提案されたスペクトルエネルギー距離は、従来のimplicitモデルに比べ、知覚的品質と指標スコアにおいて優れているか?
  • RQ4スペクトルエネルギー距離を敵対的学習と組み合わせることで、音声品質とモデルの安定性にどのような影響を与えるか?
  • RQ5効率的なアーキテクチャを用いて、高速な推論を実現しながら高精細な音声生成を維持できるか?

主な発見

  • 提案されたスペクトルエネルギー距離は、cFDSD指標においてimplicitな生成モデルの中で最先端の性能を達成し、優れたサンプル品質と多様性を示した。
  • GAN学習と組み合わせた場合、平均意見スコア(MOS)は4.25±0.06を達成し、GEDのみのモデルやGAN-TTSベースラインを上回った。
  • スペクトルエネルギー距離で訓練されたiSTFTジェネレータアーキテクチャは、わずか10,000回のパラメータ更新で最適なcFDSDスコアに到達し、GAN-TTSジェネレータの約半分の推論速度を達成した。
  • スペクトルエネルギー距離で訓練されたモデルは急速に収束し、10,000~20,000回の更新で良好な性能を達成したが、正則化がなければ長時間学習すると過学習が発生した。
  • 敵対的損失が不要な安定した学習が可能であり、反発項が最適な生成品質を達成するために実証的に重要であることが示された。
  • 一般化エネルギー距離は、反発項を含むタイプの最初の適切なスコアルールであり、従来のスペクトログラムベースの損失とは明確に区別される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。