Skip to main content
QUICK REVIEW

[论文解读] Differentiable WORLD Synthesizer-based Neural Vocoder With Application To End-To-End Audio Style Transfer

Shahan Nercessian|arXiv (Cornell University)|Aug 15, 2022
Speech and Audio Processing被引用 6
一句话总结

本文提出了一种可微分的 WORLD 合成器,用于端到端音频风格迁移,实现了无需可学习参数的高保真、音高保持的神经声码合成。通过利用可微分信号处理和可选的轻量级后网,该方法在重建质量方面达到最先进水平,并在语音转换和音色迁移任务中表现出稳定的训练性能,尤其在音高保持方面表现优异。

ABSTRACT

In this paper, we propose a differentiable WORLD synthesizer and demonstrate its use in end-to-end audio style transfer tasks such as (singing) voice conversion and the DDSP timbre transfer task. Accordingly, our baseline differentiable synthesizer has no model parameters, yet it yields adequate synthesis quality. We can extend the baseline synthesizer by appending lightweight black-box postnets which apply further processing to the baseline output in order to improve fidelity. An alternative differentiable approach considers extraction of the source excitation spectrum directly, which can improve naturalness albeit for a narrower class of style transfer applications. The acoustic feature parameterization used by our approaches has the added benefit that it naturally disentangles pitch and timbral information so that they can be modeled separately. Moreover, as there exists a robust means of estimating these acoustic features from monophonic audio sources, it allows for parameter loss terms to be added to an end-to-end objective function, which can help convergence and/or further stabilize (adversarial) training.

研究动机与目标

  • 开发一种可微分的 WORLD 声码器,以在神经音频合成中保持相位一致性和音高轮廓。
  • 通过将可微分信号处理整合到训练目标中,实现音频风格迁移系统的端到端训练。
  • 探索替代的可微分架构,包括直接操纵激励谱,以在特定应用中提升自然度。
  • 证明非参数化、可微分的合成器可在实现竞争性合成质量的同时,实现音高与音色的解耦建模。
  • 通过引入真实声学特征参数化作为监督信号,稳定对抗性训练中的神经声码器。

提出的方法

  • 基线可微分 WORLD 合成器通过可微分实现原始 WORLD 算法,从基频(f0)、谱包络(sp)和非周期性(ap)重建音频。
  • 在合成器输出后附加一个轻量级、非自回归的后网,以提升频谱保真度并减少伪影。
  • 另一种方法直接操纵激励谱,施加新的谱包络,同时保持源信号的谐波成分。
  • 声学特征表示自然地将音高(f0)与音色(sp, ap)解耦,支持通过参数损失项对两者分别建模与监督。
  • 采用对数梅尔倒谱图的 L1 损失进行端到端训练,必要时结合判别器和特征损失进行对抗性训练。
  • 使用真实 WORLD 参数作为特征损失监督的目标,提升对抗性训练中的收敛性与稳定性。

实验结果

研究问题

  • RQ1可微分的 WORLD 声码器是否能在无可学习参数的情况下实现高保真音频合成?
  • RQ2可微分 WORLD 合成如何提升端到端音频风格迁移系统中的训练稳定性和收敛性?
  • RQ3后网模块在非自回归、可微分声码器框架中能在多大程度上提升合成质量?
  • RQ4与全波形合成相比,直接操纵激励谱是否能在音色迁移任务中带来更好的自然度?
  • RQ5声学特征参数化(f0, sp, ap)是否可作为端到端训练中的有效监督信号,以提升模型性能?

主要发现

  • 可微分 WORLD 合成器在歌唱语音转换(SVC)任务上的梅尔倒谱图重建误差为 0.2050,作为强大的非参数基线。
  • 采用后网和对抗性训练的变体(E2E+DiffWORLDSynth+Postnet+GAN)重建误差略高(0.2215),但感知质量更优,频谱细节更丰富。
  • 使用真实目标的“理想监督”变体(E2E+DiffWORLDSynth+Oracle)达到显著更低的误差(0.1014),证明真实声学监督的优越性。
  • 基于激励的改进方法(E2E+DiffWORLDExcite)实现了最低的重建误差(0.0421),表明当激励谱估计准确时性能更优。
  • 可微分合成器成功实现了 DDSP 音色迁移任务的端到端训练,重建误差为 0.2465,表明其在语音转换之外任务中的泛化能力。
  • 对抗性训练通过收紧 formant 带宽并减少嗡鸣感,提升了感知质量,即使 L1 误差略有上升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。