Skip to main content
QUICK REVIEW

[论文解读] Diff-TTS: A Denoising Diffusion Model for Text-to-Speech

Myeonghun Jeong, Hyeongju Kim|arXiv (Cornell University)|Apr 3, 2021
Speech Recognition and Synthesis参考文献 28被引用 8
一句话总结

Diff-TTS 提出了一种基于去噪扩散概率模型(DDPM)的非自回归文本到语音模型,通过基于似然的优化方法学习文本条件下的梅尔频谱图分布,从而生成高保真、自然的语音。该模型在单张 GPU 上实现了 28 倍于实时速度的推理速度,同时保持了高感知质量,并且参数量比 Tacotron2 和 Glow-TTS 减少了 53%。

ABSTRACT

Although neural text-to-speech (TTS) models have attracted a lot of attention and succeeded in generating human-like speech, there is still room for improvements to its naturalness and architectural efficiency. In this work, we propose a novel non-autoregressive TTS model, namely Diff-TTS, which achieves highly natural and efficient speech synthesis. Given the text, Diff-TTS exploits a denoising diffusion framework to transform the noise signal into a mel-spectrogram via diffusion time steps. In order to learn the mel-spectrogram distribution conditioned on the text, we present a likelihood-based optimization method for TTS. Furthermore, to boost up the inference speed, we leverage the accelerated sampling method that allows Diff-TTS to generate raw waveforms much faster without significantly degrading perceptual quality. Through experiments, we verified that Diff-TTS generates 28 times faster than the real-time with a single NVIDIA 2080Ti GPU.

研究动机与目标

  • 开发一种非自回归 TTS 模型,实现高自然度与架构高效性。
  • 将此前在图像和语音生成中表现成功的去噪扩散模型应用于文本到语音合成,以提升生成样本质量与训练稳定性。
  • 通过潜在空间方差与噪声缩放实现无需微调的韵律可调控性。
  • 通过加速采样技术提升推理速度,同时保持感知质量。
  • 在不牺牲音频保真度的前提下,相比自回归与基于流的 TTS 模型,减小模型规模。

提出的方法

  • 使用去噪扩散框架,在 T 个时间步内将噪声信号转化为梅尔频谱图,条件输入为文本。
  • 采用源自 DDPM 框架的基于似然的优化目标进行训练,无需辅助损失。
  • 应用马尔可夫反向扩散过程,从高斯先验开始,从噪声生成梅尔频谱图。
  • 引入基于蒸馏的加速采样方法,使用温度缩放因子 γ 以减少推理步数。
  • 通过调节潜在空间方差与加性噪声,利用温度超参数 η 控制韵律可变性。
  • 采用 U-Net 架构作为去噪网络,并引入交叉注意力机制以关注文本嵌入。
Figure 1: Graphical model for the reverse process and the diffusion process.
Figure 1: Graphical model for the reverse process and the diffusion process.

实验结果

研究问题

  • RQ1去噪扩散模型能否在非自回归文本到语音合成中有效应用,并实现高感知质量?
  • RQ2与回归或基于流的目标函数相比,所提出的基于似然的训练目标在音频质量与模型效率方面表现如何?
  • RQ3加速采样在多大程度上可减少推理时间而不降低语音质量?
  • RQ4是否能通过潜在空间方差与噪声缩放有效控制合成语音的韵律可变性?
  • RQ5在保持高保真输出的前提下,Diff-TTS 的模型规模与当前最先进的 TTS 模型(如 Tacotron2 和 Glow-TTS)相比如何?

主要发现

  • Diff-TTS 在 95% 置信区间(±0.064)内达到 4.337 的平均意见得分(MOS),优于 Tacotron2(4.006)与 Glow-TTS(4.160),且仅使用 13.4M 参数——比两者均减少 53%。
  • 在加速采样(γ=57)下,Diff-TTS 在单张 NVIDIA 2080Ti GPU 上实现 0.035 RTF(28 倍于实时速度)的推理速度,同时保持与 Tacotron2 相当的 MOS。
  • 通过采样参数 γ 可调节模型推理速度,实现根据计算资源约束在速度与质量之间的可调平衡。
  • 通过温度参数 η 可控制韵律可变性:更高值(如 η=0.6)可增加音高变化与多样性,且不降低质量。
  • 即使在高加速水平下,模型仍保持高感知质量,MOS 仅从 γ=1 时的 4.337 略降至 γ=57 时的 4.091,表明对加速具有强鲁棒性。
  • Diff-TTS 表明,扩散模型可被有效应用于 TTS,实现稳定训练、架构自由与卓越的参数效率。
Figure 2: Graphical model for the accelerated sampling with $\gamma=1,2,3$ .
Figure 2: Graphical model for the accelerated sampling with $\gamma=1,2,3$ .

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。