Skip to main content
QUICK REVIEW

[论文解读] Multi-band MelGAN: Faster Waveform Generation for High-Quality Text-to-Speech

Geng Yang, Shan Yang|arXiv (Cornell University)|May 11, 2020
Speech Recognition and Synthesis参考文献 26被引用 21
一句话总结

本文提出多带梅尔谱图生成器(Multi-band MelGAN,MB-MelGAN),通过扩展感受野、以多分辨率短时傅里叶变换(STFT)损失替代特征匹配损失,并引入多带波形生成,实现更快且音质更高的神经声码器,用于文本到语音合成。该模型在波形生成中取得4.34的MOS评分,在TTS任务中取得4.22的MOS评分,仅使用191万参数和0.95 GFLOPS计算量,可在CPU上实现0.03的实时因子(RTF),比原始MelGAN快7倍,同时保持高音质。

ABSTRACT

In this paper, we propose multi-band MelGAN, a much faster waveform generation model targeting to high-quality text-to-speech. Specifically, we improve the original MelGAN by the following aspects. First, we increase the receptive field of the generator, which is proven to be beneficial to speech generation. Second, we substitute the feature matching loss with the multi-resolution STFT loss to better measure the difference between fake and real speech. Together with pre-training, this improvement leads to both better quality and better training stability. More importantly, we extend MelGAN with multi-band processing: the generator takes mel-spectrograms as input and produces sub-band signals which are subsequently summed back to full-band signals as discriminator input. The proposed multi-band MelGAN has achieved high MOS of 4.34 and 4.22 in waveform generation and TTS, respectively. With only 1.91M parameters, our model effectively reduces the total computational complexity of the original MelGAN from 5.85 to 0.95 GFLOPS. Our Pytorch implementation, which will be open-resourced shortly, can achieve a real-time factor of 0.03 on CPU without hardware specific optimization.

研究动机与目标

  • 提升MelGAN在高保真语音合成中的音质与训练稳定性。
  • 在不牺牲音质的前提下,降低计算复杂度并加速推理速度。
  • 解决原始MelGAN中出现的抖动与金属感等可听失真问题。
  • 实现在资源受限设备上高效、实时的CPU推理,以支持实际TTS部署。
  • 验证多带处理在降低模型复杂度的同时保持感知音质的有效性。

提出的方法

  • 扩展MelGAN生成器的感受野,以改善长程语音依赖关系建模。
  • 以多分辨率STFT损失替代原始的特征匹配损失,以更好地捕捉真实语音与生成语音之间的频谱与时间差异。
  • 引入多带处理框架,其中生成器预测子带波形,并通过相加合成全带输出。
  • 在子带与全带波形上均应用多分辨率STFT损失,以增强感知音质与训练稳定性。
  • 采用预训练策略,以提升对抗训练过程中的收敛性与音质。
  • 在所有子带中共享单一生成器网络,以减少参数量与计算成本。

实验结果

研究问题

  • RQ1扩展MelGAN的感受野是否能显著提升语音质量与训练稳定性?
  • RQ2以多分辨率STFT损失替代特征匹配损失是否能带来更好的感知音质与更快的收敛速度?
  • RQ3多带处理是否能在保持高保真语音生成的同时降低计算复杂度?
  • RQ4结合子带与全带多分辨率STFT损失对音质与训练动态有何影响?
  • RQ5MB-MelGAN能否在极低参数量与低实时因子下实现高MOS评分,以支持CPU上的实时TTS应用?

主要发现

  • MB-MelGAN在波形生成任务中取得4.34的平均意见得分(MOS),显著优于原始MelGAN的3.98。
  • 在文本到语音任务中,MB-MelGAN取得4.22的MOS评分,优于原始MelGAN(3.87)与FB-MelGAN(4.18)。
  • 模型将计算复杂度从原始MelGAN的5.85 GFLOPS降低至0.95 GFLOPS,实现在CPU上0.03的实时因子(RTF)。
  • 多带设计使训练时间相比全带模型减少约50%,同时保持或提升音质。
  • 结合子带与全带多分辨率STFT损失可同时提升音质与训练稳定性,实现更快收敛。
  • 模型仅使用191万参数即可实现高质量语音合成,使其在资源受限设备上部署极具效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。