Skip to main content
QUICK REVIEW

[论文解读] Bandwidth Extension on Raw Audio via Generative Adversarial Networks

Sung Hoon Kim, Visvesh Sathe|arXiv (Cornell University)|Mar 21, 2019
Advanced Image Processing Techniques参考文献 26被引用 21
一句话总结

该论文提出了一种基于生成对抗网络(GAN)的音频超分辨率方法,采用从卷积自编码器中提取的无监督特征损失,无需依赖标注数据或预训练分类器。该方法在语音和音乐任务中均实现了客观与主观质量的最先进性能,相较于基线方法,在高频内容重建方面有显著提升,且伪影更少。

ABSTRACT

Neural network-based methods have recently demonstrated state-of-the-art results on image synthesis and super-resolution tasks, in particular by using variants of generative adversarial networks (GANs) with supervised feature losses. Nevertheless, previous feature loss formulations rely on the availability of large auxiliary classifier networks, and labeled datasets that enable such classifiers to be trained. Furthermore, there has been comparatively little work to explore the applicability of GAN-based methods to domains other than images and video. In this work we explore a GAN-based method for audio processing, and develop a convolutional neural network architecture to perform audio super-resolution. In addition to several new architectural building blocks for audio processing, a key component of our approach is the use of an autoencoder-based loss that enables training in the GAN framework, with feature losses derived from unlabeled data. We explore the impact of our architectural choices, and demonstrate significant improvements over previous works in terms of both objective and perceptual quality.

研究动机与目标

  • 解决在不依赖标注数据集或辅助分类器的情况下训练 GAN 进行音频超分辨率的挑战。
  • 开发一种鲁棒的端到端深度学习架构,用于原始音频超分辨率,以提升主观与客观音频质量。
  • 提出一种基于自编码器的无监督特征损失,以稳定 GAN 训练并增强重建保真度。
  • 在多种音频领域(包括语音和音乐)及多种上采样比率下,验证该方法的有效性。
  • 提供详细的消融研究,分析模型深度、损失组件及架构选择对性能的影响。

提出的方法

  • 该方法采用类似 U-Net 的编码器-解码器架构 MU-GAN,专为原始音频超分辨率设计,包含残差块和空洞卷积。
  • 提出一种新颖的无监督特征损失,源自预训练的卷积自编码器,从中提取自编码器瓶颈层的中间特征表示。
  • 该特征损失在自编码器的潜在空间中度量高分辨率音频与重建音频之间的感知相似性,替代传统的基于分类器的损失。
  • 模型通过对抗损失、波形上的 L2 损失以及所提出的无监督特征损失联合训练,以稳定训练过程并提升生成的真实性。
  • 用于特征损失的自编码器在无标注音频数据上进行预训练,使该方法能泛化至多样化的音频内容,而无需领域特定的标注。
  • 该框架支持从 R=2 到 R=6 的上采样比率,消融研究评估了各损失组件及模型深度的贡献。

实验结果

研究问题

  • RQ1基于 GAN 的音频超分辨率模型是否能在不依赖标注数据或预训练分类器的情况下实现最先进性能?
  • RQ2基于自编码器提取的无监督特征损失与基于分类器的特征损失相比,在音频质量和训练稳定性方面表现如何?
  • RQ3模型深度及损失组件(对抗损失、L2 损失、特征损失)对高上采样比率下的主观与客观音频质量有何影响?
  • RQ4与现有基线方法相比,该方法是否显著提升了高频内容的重建效果?
  • RQ5无监督特征损失是否能有效稳定音频生成任务中的 GAN 训练,减少伪影和过度平滑?

主要发现

  • 所提出的无监督特征损失在相同任务上性能与基于分类器的损失(如 VGG)相当,甚至在某些情况下略优,且完全无需任何标注数据。
  • 在 R=6 时,MU-GAN8 模型的 MOS-LQO 得分为 3.21,显著优于 U-net8 基线模型在 R=4 时的 3.17 和 R=6 时的 3.07。
  • 消融研究显示,将对抗损失和无监督特征损失加入浅层 MU-GAN4 模型后,其在 R=4 时的 MOS-LQO 从 3.15 提升至 3.79,证明了其在缓解欠拟合方面的有效性。
  • 采用所提损失后,模型在 R=2 时达到 21.40 dB 的 SNR,在 R=6 时达到 13.98 dB,表明在不同上采样比率下性能保持一致。
  • 在 A/B 用户测试中,MU-GAN8 在钢琴任务中 15 次比较中有 14 次胜出,在说话人任务中 15 次比较全部胜出,表明其具有显著的主观优势。
  • 频谱图分析证实,MU-GAN8 更好地重建了高频分量,尤其在清辅音如 'k' 和 's' 上,这些音素在基线输出中常被模糊或掩盖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。