Skip to main content
QUICK REVIEW

[論文レビュー] ResGrad: Residual Denoising Diffusion Probabilistic Models for Text to Speech

Zehua Chen, Yihan Wu|arXiv (Cornell University)|Dec 30, 2022
Speech Recognition and Synthesis被引用数 5
ひとこと要約

ResGradは、既存のTTSモデル(例:FastSpeech 2)の出力と真値のメルスペクトログラムの差分(残差)を学習することで、テキスト対音声合成の品質を向上させる軽量な残差ノイズ除去拡散モデルを提案する。これにより、ベースラインの拡散手法と比較して10倍以上の高速化を達成しながら、高精細な音声生成が可能となり、リアルタイム要因を大幅に低減する。

ABSTRACT

Denoising Diffusion Probabilistic Models (DDPMs) are emerging in text-to-speech (TTS) synthesis because of their strong capability of generating high-fidelity samples. However, their iterative refinement process in high-dimensional data space results in slow inference speed, which restricts their application in real-time systems. Previous works have explored speeding up by minimizing the number of inference steps but at the cost of sample quality. In this work, to improve the inference speed for DDPM-based TTS model while achieving high sample quality, we propose ResGrad, a lightweight diffusion model which learns to refine the output spectrogram of an existing TTS model (e.g., FastSpeech 2) by predicting the residual between the model output and the corresponding ground-truth speech. ResGrad has several advantages: 1) Compare with other acceleration methods for DDPM which need to synthesize speech from scratch, ResGrad reduces the complexity of task by changing the generation target from ground-truth mel-spectrogram to the residual, resulting into a more lightweight model and thus a smaller real-time factor. 2) ResGrad is employed in the inference process of the existing TTS model in a plug-and-play way, without re-training this model. We verify ResGrad on the single-speaker dataset LJSpeech and two more challenging datasets with multiple speakers (LibriTTS) and high sampling rate (VCTK). Experimental results show that in comparison with other speed-up methods of DDPMs: 1) ResGrad achieves better sample quality with the same inference speed measured by real-time factor; 2) with similar speech quality, ResGrad synthesizes speech faster than baseline methods by more than 10 times. Audio samples are available at https://resgrad1.github.io/.

研究の動機と目的

  • テキスト対音声(TTS)合成におけるノイズ除去拡散確率的モデル(DDPMs)の推論速度が遅いため、リアルタイムでの適用が制限される問題に対処する。
  • DDPMsがモデリングすべきデータ空間の複雑さを低減するため、生の音声からではなく、TTSモデル出力と真値との間の残差を生成ターゲットに移行する。
  • ベースTTSシステムの再トレーニングを必要とせず、即座に統合可能なプラグアンドプレイ設計を実現し、推論コストを最小限に抑えつつ、サンプル品質を向上させる。
  • 残差データ上でトレーニングされた軽量な拡散モデルを活用することで、小さなリアルタイム要因で高精細な音声生成を実現する。

提案手法

  • 既存のTTSモデル(例:FastSpeech 2)が出力するメルスペクトログラムと、対応する真値メルスペクトログラムとの差分を予測するように、ResGradと呼ばれる拡散モデルを訓練する。
  • 残差畳み込みとスカイプ接続を備えた軽量なU-Netアーキテクチャを採用し、残差空間を効率的にモデル化する。
  • 推論時、ResGradが出力するノイズ除去済みの残差を、元のTTSモデルのメルスペクトログラムに加算することで、最終的なスペクトログラムを精緻化する。
  • 少量のサンプリングステップ(例:4〜50)でノイズからクリアな残差信号を生成するノイズ除去拡散プロセスを適用し、高速な推論を実現する。
  • 残差空間は全メルスペクトログラム空間よりも複雑さが低いため、小さなモデルと少ないステップ数で高品質な結果を達成可能であることを活用する。
  • ベースTTSシステムの再トレーニングを必要とせず、任意の既存TTSモデルと互換性を持つプラグアンドプレイ設計を確保する。

実験結果

リサーチクエスチョン

  • RQ1TTSモデル出力と真値メルスペクトログラムとの間の残差をモデリングすることで、拡散モデリングの複雑さを軽減し、推論を高速化できるか?
  • RQ2残差データ上でトレーニングされた軽量な拡散モデルは、同じ推論速度下で、全スペクトル拡散モデルよりも高いサンプル品質を達成できるか?
  • RQ3ResGradは、シングルスピーカー、マルチスピーカー、高サンプリングレート設定を含む多様なTTSデータセットに効果的に適用可能か?
  • RQ4モデルサイズ、推論速度、音声品質の観点から、ResUNetなどの既存の残差ベースモデルと比較して、ResGradの性能はどの程度優れているか?
  • RQ5残差学習アプローチは、リアルタイム要因を低減しつつ、知覚的品質(例:CMOS)を維持または向上させるか、その程度はいかほどか?

主な発見

  • 同じリアルタイム要因(RTF)下で、ベースラインの高速化手法よりも高いサンプル品質を達成し、LJ SpeechではCMOSスコア0.00、LibriTTSでも0.00を記録。推論速度が同一の条件下で他手法を上回る。
  • 同程度の音声品質(CMOS ≈ 0.00)を維持しながら、ベースラインの拡散モデルと比較して推論時間を10倍以上短縮。LibriTTSではRTF 0.223、VCTKでは0.244を達成。
  • ResGradのモデルサイズはわずか2.03Mパラメータであり、ResUNet(31.8M)と比べて著しく小さい。これにもかかわらず、より優れたCMOS性能を達成しており、効率性と有効性の両面で優位性を示す。
  • ケーススタディの結果、FastSpeech 2が過剰に平滑化するのに対し、ResGradはより詳細な周波数成分を含むメルスペクトログラムを生成しており、より表現的で自然な音声が得られることを示している。
  • より大きな拡散モデル(ResGrad-L、7.68Mパラメータ)を用いても、小さなResGradと比較して性能向上は限定的であり、残差学習を用いる場合、モデルサイズが性能に与える影響は小さいことが示された。
  • わずか4ステップのサンプリングステップでも、知覚的にクリアな残差信号が生成されることから、残差空間の複雑さが低いため、最小限のステップ数で高品質な結果が得られることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。