Skip to main content
QUICK REVIEW

[论文解读] HooliGAN: Robust, High Quality Neural Vocoding

Ollie McCarthy, Zohaib Ahmed|arXiv (Cornell University)|Aug 6, 2020
Music and Audio Processing参考文献 15被引用 10
一句话总结

HooliGAN 是一种鲁棒且高质量的神经声码器,结合了可微分数字信号处理(DDSP)与神经源-滤波器(NSF)技术,并采用对抗性训练,以生成自然的语音。它在快速推理(GPU 上达 2.2MHz)、小样本数据集(<30 分钟)上表现出强泛化能力,且在主观听音测试中表现出卓越的感知质量。

ABSTRACT

Recent developments in generative models have shown that deep learning combined with traditional digital signal processing (DSP) techniques could successfully generate convincing violin samples [1], that source-excitation combined with WaveNet yields high-quality vocoders [2, 3] and that generative adversarial network (GAN) training can improve naturalness [4, 5]. By combining the ideas in these models we introduce HooliGAN, a robust vocoder that has state of the art results, finetunes very well to smaller datasets (&lt;30 minutes of speechdata) and generates audio at 2.2MHz on GPU and 35kHz on CPU. We also show a simple modification to Tacotron-basedmodels that allows seamless integration with HooliGAN. Results from our listening tests show the proposed model's ability to consistently output high-quality audio with a variety of datasets, big and small. We provide samples at the following demo page: https://resemble-ai.github.io/hooligan_demo/

研究动机与目标

  • 开发一种神经声码器,实现高感知质量的同时保持快速推理速度。
  • 提升在小样本语音数据集(<30 分钟)上的鲁棒性与泛化能力。
  • 与基于 Tacotron 的文本到语音系统无缝集成。
  • 通过源激励建模减少相位模糊性和波形离散化带来的失真。
  • 结合 DDSP(基于 DSP 的信号建模)与 NSF(神经滤波)的优势,以提升音频质量。

提出的方法

  • 模型以对数梅尔频谱图、基频(F0)和未音素/有音素(UV)序列为输入,这些特征从声学特征中提取。
  • 编码器包含两个一维卷积层和一个全连接层,用于处理输入并生成振荡器与噪声控制参数。
  • 通过线性插值将帧级参数上采样至样本级,叠加振荡器生成谐波分量。
  • 神经滤波模块受 NSF 启发,使用空洞因果卷积处理激励信号,以建模谱包络动态特性。
  • 判别器采用大卷积核、步长大卷积(如 MelGAN 所用),以实现相位无关训练并提升感知质量。
  • 采用对抗性训练与 GAN 目标函数,增强语音自然性并减少自回归模型中常见的失真。

实验结果

研究问题

  • RQ1结合 DDSP 风格的源激励与 NSF 风格的神经滤波的混合方法,是否能生成比端到端波形模型更高质量的语音?
  • RQ2该模型在极小语音数据集(<30 分钟)上微调时表现如何?
  • RQ3该模型能否在保持与最先进声码器相当的感知质量的同时,实现高推理速度?
  • RQ4显式建模 F0 和 UV 状态是否能提升对梅尔频谱图中谐波成分被压缩的男声的鲁棒性?
  • RQ5该模型能否与基于 Tacotron 的文本到语音流水线无缝集成?

主要发现

  • 在 LJSpeech 测试集的主观听音测试中,HooliGAN 的平均意见分(MOS)达到 4.07,优于 WaveRNN、MelGAN 和 WaveGlow。
  • 该模型在小样本数据集上表现出卓越的鲁棒性,尤其在仅用 30 分钟数据微调时,性能显著提升,男性语音效果尤为突出。
  • HooliGAN 在 GPU 上实现 2.2MHz 的推理速度,在 CPU 上达 35kHz,速度优于 WaveRNN 和 WaveGlow,同时保持高质量输出。
  • 与易受直接波形训练中相位相关失真影响的 WaveRNN 和 WaveGlow 相比,HooliGAN 输出的“模糊”失真更少。
  • HooliGAN 的 MOS 接近真实语音水平,表明其与 Tacotron2 兼容性极强,感知保真度高。
  • 通过显式源激励与 DSP 组件构建的模型架构,降低了复杂度并提升了泛化能力,尤其在低数据场景下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。