Skip to main content
QUICK REVIEW

[论文解读] NU-GAN: High resolution neural upsampling with GAN

Rithesh Kumar, Kundan Kumar|arXiv (Cornell University)|Oct 22, 2020
Speech Recognition and Synthesis参考文献 20被引用 22
一句话总结

NU-GAN 提出了一种基于 GAN 的神经上采样方法,通过在幅度谱图的频域上操作,将低分辨率音频(22 kHz)转换为高分辨率音频(44.1 kHz),避免了相位估计的挑战。其结果与原始 44.1 kHz 音频几乎无法区分,ABX 测试显示,单说话人和多说话人数据集的区分度分别仅比随机猜测高 7.4% 和 10.8%。

ABSTRACT

In this paper, we propose NU-GAN, a new method for resampling audio from lower to higher sampling rates (upsampling). Audio upsampling is an important problem since productionizing generative speech technology requires operating at high sampling rates. Such applications use audio at a resolution of 44.1 kHz or 48 kHz, whereas current speech synthesis methods are equipped to handle a maximum of 24 kHz resolution. NU-GAN takes a leap towards solving audio upsampling as a separate component in the text-to-speech (TTS) pipeline by leveraging techniques for audio generation using GANs. ABX preference tests indicate that our NU-GAN resampler is capable of resampling 22 kHz to 44.1 kHz audio that is distinguishable from original audio only 7.4% higher than random chance for single speaker dataset, and 10.8% higher than chance for multi-speaker dataset.

研究动机与目标

  • 解决文本到语音系统仅能生成最高 24 kHz 音频的空白,尽管某些应用需要 44.1 kHz 的高分辨率音频。
  • 克服语音中高频分量与文本和说话人身份相关性差的挑战。
  • 开发一种快速、前馈式的神经上采样器,可作为即插即用模块集成到现有 TTS 流水线中,而无需修改原始的文本到谱图或声码器阶段。
  • 实现在此情境下此前未实现的 44.1 kHz 高质量音频超分辨率,达到高保真度。
  • 提供计算高效的解决方案,避免原始波形生成和相位重建的复杂性。

提出的方法

  • NU-GAN 通过首先在时域应用 sinc 插值,将 22 kHz 音频上采样至 44.1 kHz 来执行神经上采样。
  • 然后对插值后的信号计算短时傅里叶变换(STFT),以获得幅度谱图。
  • 该模型在频域中运行,专注于预测缺失的高频幅度频段,同时保留相位信息。
  • 采用基于 GAN 的架构,训练模型生成逼真的高频分量,判别器用于区分真实与生成的高分辨率谱图。
  • 该方法完全前馈,支持快速推理和并行采样,与自回归模型不同。
  • 训练目标结合对抗损失、感知损失和重建损失,以确保生成音频的保真度和自然性。

实验结果

研究问题

  • RQ1基于 GAN 的方法能否有效生成与文本和说话人身份相关性差的语音高频分量?
  • RQ2与原始波形生成相比,对幅度谱图进行频域建模在音频超分辨率中是否更有效且高效?
  • RQ3能否训练神经上采样器,使生成的 44.1 kHz 音频在感知上与原始高分辨率录音无法区分?
  • RQ4在单说话人和多说话人设置下,NU-GAN 相较于基线 sinc 插值在感知质量方面的表现如何?
  • RQ5NU-GAN 是否能无缝集成到现有 TTS 流水线中,而无需重新训练初始的文本到谱图或声码器组件?

主要发现

  • 在单说话人数据集上,NU-GAN 使与原始 44.1 kHz 音频的感知可区分性仅比随机猜测高 7.4%。
  • 在包含 20 位说话人的多说话人数据集中,NU-GAN 的可区分性得分比随机猜测高 10.8%,表明其具有强大的泛化能力。
  • 在单说话人数据集上,NU-GAN 相较于基线 sinc 插值在 ABX 准确率上提升了约 20 个百分点。
  • 该模型完全前馈,采样速度快,支持实时或近实时的音频超分辨率。
  • 在 TTS 流水线上的定性结果显示,NU-GAN 生成的语音更清晰、更自然,辅音和摩擦音的细节更丰富。
  • NU-GAN 是首个在 44.1 kHz 分辨率下实现感知高质量音频超分辨率的方法,此前该分辨率在深度生成模型中尚未实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。