Skip to main content
QUICK REVIEW

[论文解读] Fre-GAN: Adversarial Frequency-consistent Audio Synthesis

Ji-Hoon Kim, Sanghoon Lee|arXiv (Cornell University)|Jun 4, 2021
Music and Audio Processing参考文献 32被引用 7
一句话总结

Fre-GAN 提出了一种基于分辨率连接生成器和基于离散小波变换(DWT)进行无损下采样的分辨率判别器的频率一致神经声码器,实现了接近人类水平的音频质量,与真实音频的MOS差距仅为0.03,优于现有基于GAN的声码器在保真度和频谱一致性方面的表现。

ABSTRACT

Although recent works on neural vocoder have improved the quality of synthesized audio, there still exists a gap between generated and ground-truth audio in frequency space. This difference leads to spectral artifacts such as hissing noise or reverberation, and thus degrades the sample quality. In this paper, we propose Fre-GAN which achieves frequency-consistent audio synthesis with highly improved generation quality. Specifically, we first present resolution-connected generator and resolution-wise discriminators, which help learn various scales of spectral distributions over multiple frequency bands. Additionally, to reproduce high-frequency components accurately, we leverage discrete wavelet transform in the discriminators. From our experiments, Fre-GAN achieves high-fidelity waveform generation with a gap of only 0.03 MOS compared to ground-truth audio while outperforming standard models in quality.

研究动机与目标

  • 解决由生成音频与真实音频在频域空间不一致导致的神经声码器中的频谱伪影(如嘶嘶声和混响)。
  • 通过在波形生成过程中确保多个频带的频谱分布一致,提升音频保真度。
  • 通过渐进式训练和按分辨率设计的判别器,在对抗训练中实现稳定。
  • 用离散小波变换(DWT)替代传统平均池化,以在下采样过程中保留高频分量。
  • 在主观和客观指标(包括MOS、MCD和FDSD)上均实现最先进性能。

提出的方法

  • 采用分辨率连接生成器(RCG),通过最近邻上采样和跳跃连接,将多个分辨率层级的波形进行上采样并求和。
  • 使用按分辨率设计的判别器(RPD和RSD),在不同尺度上评估生成的波形,每个判别器通过DWT接收下采样的音频,以实现多尺度频谱一致性。
  • 在判别器中将DWT作为下采样方法,利用其双正交性和能量保持特性,以维持高频分量。
  • 在每个分辨率层级上,以输入的梅尔频谱图作为条件,确保跨尺度的频率一致性。
  • 对RCG采用渐进式训练,从低分辨率输出开始,逐步添加更高分辨率的组件,以稳定训练过程。
  • 在判别器中集成多周期判别器(MPD)和多尺度判别器(MSD)组件,以捕捉周期性模式和长期依赖关系。

实验结果

研究问题

  • RQ1通过在下采样过程中保留高频分量,基于GAN的声码器能否实现频率一致的音频合成?
  • RQ2用离散小波变换(DWT)替代平均池化,对神经音频生成中的频谱保真度和主观质量有何影响?
  • RQ3分辨率连接生成器(RCG)在多尺度频谱学习和训练稳定性方面有多大的提升作用?
  • RQ4各架构组件——RCG、DWT、MPD/MSD以及梅尔频谱图条件化——对整体音频质量的贡献分别是什么?
  • RQ5所提出的方法能否在MOS指标上实现接近完美的主观质量,与真实音频相比?

主要发现

  • Fre-GAN的主观MOS得分为4.25 ± 0.04,与真实音频(4.39 ± 0.03)的差距仅为0.03,表明其达到了接近人类水平的主观质量。
  • 该模型在MOS和客观指标上均优于HiFi-GAN V2(MOS: 4.08 ± 0.05)和WaveNet,MCD 13为1.383,FDSD为0.209。
  • 将DWT替换为平均池化(AP)后,MOS显著下降至4.12 ± 0.05,MCD 13上升至1.592,证实DWT在保留高频分量方面具有关键作用。
  • 消融实验表明,若移除RCG架构,MCD 13恶化至1.602,表明其在多尺度频谱学习中的关键作用。
  • 通过RCG实现的渐进式训练使学习过程稳定,注意力随时间从低分辨率逐步转向高分辨率,且DWT确保了高频分量的可访问性。
  • 梅尔频谱图差异的可视化分析(图3)表明,Fre-GAN生成的音频在频率一致性方面表现优异,与真实音频的像素级误差极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。