Skip to main content
QUICK REVIEW

[论文解读] Generative adversarial network-based approach to signal reconstruction from magnitude spectrograms

K. Oyamada, Hirokazu Kameoka|arXiv (Cornell University)|Apr 6, 2018
Image and Signal Denoising Methods参考文献 2被引用 5
一句话总结

该论文提出了一种基于生成对抗网络(GAN)的深度学习方法,通过直接从幅度谱图重建高质量的时域音频信号,绕过了传统的迭代式Griffin-Lim算法。通过使用对抗损失训练生成器网络来推断缺失的相位信息,该方法实现了更快、更高保真度的重建效果,在速度和主观质量方面均优于Griffin-Lim,尤其在GPU加速下表现更优。

ABSTRACT

In this paper, we address the problem of reconstructing a time-domain signal (or a phase spectrogram) solely from a magnitude spectrogram. Since magnitude spectrograms do not contain phase information, we must restore or infer phase information to reconstruct a time-domain signal. One widely used approach for dealing with the signal reconstruction problem was proposed by Griffin and Lim. This method usually requires many iterations for the signal reconstruction process and depending on the inputs, it does not always produce high-quality audio signals. To overcome these shortcomings, we apply a learning-based approach to the signal reconstruction problem by modeling the signal reconstruction process using a deep neural network and training it using the idea of a generative adversarial network. Experimental evaluations revealed that our method was able to reconstruct signals faster with higher quality than the Griffin-Lim method.

研究动机与目标

  • 解决从缺乏相位信息的幅度谱图重建时域音频信号的挑战。
  • 克服Griffin-Lim方法存在的收敛速度慢和音频质量不稳定等局限性。
  • 开发一种基于学习的方法,利用深度神经网络更高效地建模相位重建过程。
  • 利用生成对抗网络(GAN)通过从数据中学习真实相位模式,提升主观质量。
  • 即使仅在语音数据上进行训练,也能在未见的音频类型(如音乐)上实现良好泛化。

提出的方法

  • 训练一个深度神经网络生成器,通过推断缺失的相位分量,将幅度谱图映射为时域信号。
  • 采用GAN框架,其中生成器在判别器的对抗训练下,学习区分真实信号与生成信号。
  • 采用基于对抗训练的感知损失,隐式学习高质量相位重建度量。
  • 通过随机偏移训练谱图的相位实现数据增强,帮助生成器学习帧间相位的一致性。
  • 将生成器的输入和输出限制在奈奎斯特频率范围(0 到 fs/2)内,以利用实信号的频谱对称性。
  • 采用类似U-Net的架构实现生成器,结合步幅卷积和转置卷积,以实现特征学习与信号重建。

实验结果

研究问题

  • RQ1基于GAN的深度学习模型能否在从幅度谱图重建高保真度音频信号方面超越Griffin-Lim算法?
  • RQ2所提出的基于GAN的方法是否在保持或提升主观质量的同时,实现更快的重建速度?
  • RQ3该模型能否泛化到训练数据中未包含的音频类型(如音乐)?
  • RQ4与基于传统优化的方法相比,对抗训练在学习真实相位模式方面的有效性如何?
  • RQ5数据增强对模型学习帧间相位连续性能力的影响如何?

主要发现

  • 在主观AB测试中,所提GAN方法获得了76%的偏好率,显著优于经过400次迭代的Griffin-Lim方法。
  • 在GPU上,所提方法的重建速度约为Griffin-Lim方法的十倍,实现了近实时推理。
  • 该模型在未见的音乐信号上泛化良好,生成的波形更平滑,避免了Griffin-Lim输出中常见的不连续性。
  • 即使仅在语音数据上进行训练,该模型仍能成功重建出主观上自然的音乐信号。
  • 所提方法的处理时间与信号长度呈线性关系,使用GPU时处理时间仅为信号长度的约十分之一。
  • 在CPU上,所提方法的处理时间约为信号长度的三倍,表明为实现实时CPU部署,需进行模型压缩。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。