[论文解读] DDSP-based Singing Vocoders: A New Subtractive-based Synthesizer and A Comprehensive Evaluation
本文提出SawSing,一种基于DDSP的歌声合成声码器,通过锯齿波形和时变滤波器实现相位连续性与谐波一致性,从而生成歌声。在仅使用3小时训练数据的资源受限设置下,其性能优于最先进的基于GAN和扩散模型的声码器,展现出更快的收敛速度和更优的主观质量,尽管在非浊音中存在残余的‘嗡鸣’失真。
A vocoder is a conditional audio generation model that converts acoustic features such as mel-spectrograms into waveforms. Taking inspiration from Differentiable Digital Signal Processing (DDSP), we propose a new vocoder named SawSing for singing voices. SawSing synthesizes the harmonic part of singing voices by filtering a sawtooth source signal with a linear time-variant finite impulse response filter whose coefficients are estimated from the input mel-spectrogram by a neural network. As this approach enforces phase continuity, SawSing can generate singing voices without the phase-discontinuity glitch of many existing vocoders. Moreover, the source-filter assumption provides an inductive bias that allows SawSing to be trained on a small amount of data. Our experiments show that SawSing converges much faster and outperforms state-of-the-art generative adversarial network and diffusion-based vocoders in a resource-limited scenario with only 3 training recordings and a 3-hour training time.
研究动机与目标
- 解决神经声码器中因相位不连续和‘跳变’失真导致的歌声质量下降问题。
- 探索减法合成方法在DDSP框架中用于歌声生成的适用性。
- 评估在数据和时间受限条件下,基于DDSP的声码器的训练效率与主观质量。
- 在标准和资源受限的训练场景下,对比SawSing与最先进的神经声码器的性能。
- 识别并缓解非浊音中的感知失真,如‘嗡鸣’声。
提出的方法
- SawSing使用可微分的锯齿波振荡器作为谐波源,确保各谐波分量之间的相位连续性和谐波一致性。
- 神经网络从输入的梅尔频谱图中估计基频(f0)和时变FIR滤波器系数,以塑造谐波与噪声分量。
- 该模型结合谐波路径(滤波后的锯齿波)和随机路径(滤波后的均匀噪声)来合成歌声。
- 相位连续性通过锯齿信号的物理特性实现,减少了标准神经声码器中常见的瞬态失真。
- 采用Parselmouth进行后处理,以检测浊音/非浊音帧,并在非浊音段抑制谐波能量。
- 模型通过感知损失与重建损失的组合实现端到端训练,并在客观指标和主观MOS测试中进行评估。
实验结果
研究问题
- RQ1在DDSP框架中采用减法合成方法是否能有效建模歌声,同时保持相位连续性?
- RQ2在训练数据和时间受限条件下,SawSing相较于最先进的基于GAN和扩散模型的声码器表现如何?
- RQ3SawSing中出现了哪些感知失真(如‘嗡鸣’),是否可通过后处理或结构优化加以缓解?
- RQ4源-滤波器模型的归纳偏置是否能实现更快速的收敛和在极小数据量下的更好泛化能力?
- RQ5尽管与单音符乐器合成存在差异,DDSP中的源-滤波器结构是否仍可适配于歌声生成?
主要发现
- 在仅3小时训练数据的资源受限场景下,SawSing在男声上的平均意见得分(MOS)达到2.4,女声为2.1,显著优于HiFi-GAN的1.0得分。
- 在低数据设置下,SawSing的收敛速度更快,主观质量优于NSF、DDSP-Add和HiFi-GAN,且男声MOS差异具有统计显著性(p < 0.05)。
- 尽管收敛快且在长语句上表现优异,SawSing在非浊音辅音和气息音中仍存在‘嗡鸣’失真,原因在于谐波分量被过度滤波。
- ‘嗡鸣’失真未被标准客观损失函数捕捉,表明感知质量与训练目标之间存在差距。
- 通过Parselmouth后处理抑制非浊音段的谐波能量,显著减轻了该失真,验证了其有效性。
- 在常规训练场景下,DDSP-Add在男声上的表现优于SawSing(p < 0.05),表明加法建模对某些音素更具鲁棒性;但SawSing的训练效率使其在低数据场景中更具优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。