[論文レビュー] Diff-TTS: A Denoising Diffusion Model for Text-to-Speech
Diff-TTS は、尤度ベースの最適化によりテキストに条件付けられたメルスペクトログ램分布を学習する、ノイズ除去拡散確率的モデル(DDPM)に基づく非自己回帰的音声合成モデルを提案する。このモデルは、高精細で自然な音声を生成するが、Tacotron2 や Glow-TTS よりも 53% 少ないパラメータ数を必要とし、1 枚の GPU でリアルタイム比 28 倍の高速推論を達成する。
Although neural text-to-speech (TTS) models have attracted a lot of attention and succeeded in generating human-like speech, there is still room for improvements to its naturalness and architectural efficiency. In this work, we propose a novel non-autoregressive TTS model, namely Diff-TTS, which achieves highly natural and efficient speech synthesis. Given the text, Diff-TTS exploits a denoising diffusion framework to transform the noise signal into a mel-spectrogram via diffusion time steps. In order to learn the mel-spectrogram distribution conditioned on the text, we present a likelihood-based optimization method for TTS. Furthermore, to boost up the inference speed, we leverage the accelerated sampling method that allows Diff-TTS to generate raw waveforms much faster without significantly degrading perceptual quality. Through experiments, we verified that Diff-TTS generates 28 times faster than the real-time with a single NVIDIA 2080Ti GPU.
研究の動機と目的
- 高自然性とアーキテクチャの効率性を両立する非自己回帰的 TTS モデルの開発。
- 画像や音声生成で成功を収めたノイズ除去拡散モデルを、音声合成に応用し、サンプル品質の向上と学習安定性の向上を図ること。
- 再訓練なしで、潜在空間の分散とノイズスケーリングを用いて発音の可変性を制御可能にすること。
- 推論速度を加速サンプリングにより向上させつつ、知覚的品質を維持すること。
- 音声忠実度を損なわずに、自己回帰的およびフローベースの TTS モデルよりもモデルサイズを削減すること。
提案手法
- T ステップにわたり、テキスト入力を条件としてノイズ信号をメルスペクトログラムに変換するノイズ除去拡散フレームワークを用いる。
- DDPM フレームワークに由来する尤度ベースの最適化目的関数を採用し、補助損失を一切用いずにモデルを学習する。
- ガウス事前分布から始まり、マーコフ連鎖の逆拡散プロセスを用いてノイズからメルスペクトログラムを生成する。
- 温度スケーリング係数 γ を用いた蒸留ベースの方法により、推論ステップ数を削減する加速サンプリングを導入する。
- 温度ハイパーパrameter η を用いて潜在空間の分散と加法的ノイズを調整することで、発音の可変性を制御する。
- テキスト埋め込みに注目できるクロスアテンション機構を備えた U-Net アーキテクチャを、ノイズ除去ネットワークに採用する。

実験結果
リサーチクエスチョン
- RQ1ノイズ除去拡散モデルは、高知覚的品質を達成する非自己回帰的音声合成に効果的に適用可能か?
- RQ2本手法が採用する尤度ベースの学習目的関数は、回帰的またはフローベースの目的関数と比較して、音声品質およびモデル効率面で優れているか?
- RQ3加速サンプリングにより推論時間をどれほど短縮できるか? その際、音声品質に悪影響を及えることはないか?
- RQ4潜在空間の分散とノイズスケーリングを用いて、合成音声の発音の可変性を効果的に制御できるか?
- RQ5Diff-TTS のモデルサイズは、Tacotron2 や Glow-TTS といった最先端の TTS モデルと比較して、高精細出力の維持を前提にどの程度小さいか?
主な発見
- Diff-TTS は 95% 信頼区間 ±0.064 の平均評価得点(MOS)4.337 を達成し、両モデルより 53% 少ない 13.4M パラメータで、Tacotron2(4.006)および Glow-TTS(4.160)を上回る。
- 加速サンプリング(γ=57)を適用した場合、1 枚の NVIDIA 2080Ti GPU で推論速度が 0.035 RTF(リアルタイム比 28 倍)に達し、Tacotron2 と同等の MOS を維持する。
- 推論パラメータ γ を調整することで、計算制約に応じた速度と品質のトレードオフを自在に制御可能である。
- 温度パrameter η を用いることで発音の可変性を制御可能である:高値(例:η=0.6)に設定すると、ピッチの変動と多様性が増加するが、品質は劣化しない。
- 高加速レベルでも高い知覚的品質を維持する:γ=1(通常)の MOS 4.337 から γ=57(加速)の MOS 4.091 にわずかに低下するにとどまり、高速化に強く耐性があることが示された。
- Diff-TTS は、安定した学習、アーキテクチャの自由度、優れたパラメータ効率性を備えた TTS に拡散モデルを効果的に応用可能であることを示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。