[论文解读] Speech Synthesis and Control Using Differentiable DSP
该论文提出了一种基于可微分数字信号处理(DDSP)的神经声码器,可在推理过程中无需此类控制的情况下,对语音的可变因素(如音高、节奏、音量和音色)实现显式、解耦的控制。通过将可学习的控制变量集成到可微分DSP框架中,该模型在保持高质量、自然语音合成的同时,实现了对感知属性的细粒度操控,在长时音频的生成速度和模型大小方面优于现有声码器。
Modern text-to-speech systems are able to produce natural and high-quality speech, but speech contains factors of variation (e.g. pitch, rhythm, loudness, timbre)\ that text alone cannot contain. In this work we move towards a speech synthesis system that can produce diverse speech renditions of a text by allowing (but not requiring) explicit control over the various factors of variation. We propose a new neural vocoder that offers control of such factors of variation. This is achieved by employing differentiable digital signal processing (DDSP) (previously used only for music rather than speech), which exposes these factors of variation. The results show that the proposed approach can produce natural speech with realistic timbre, and individual factors of variation can be freely controlled.
研究动机与目标
- 开发一种语音合成系统,可提供但不强制要求对音高、节奏、音量和音色等可变因素的显式控制。
- 将此前仅用于音乐的可微分DSP(DDSP)扩展至语音合成,实现可解释且可控制的音频生成。
- 在神经声码器内部直接实现控制功能,支持对已有音频片段的修改,并与任何频谱图生成器兼容,无需重新设计架构。
- 在保持适合边缘设备部署的感知质量的前提下,实现高速合成与小型模型尺寸。
- 探索在声码器阶段解耦语音可变因素的可行性,为未来语音变化与风格编辑应用提供支持。
提出的方法
- 模型使用循环神经网络将梅尔频谱图分解为可解释的控制变量:振幅包络、谐波分布和滤波器系数。
- 这些控制变量驱动可微分DSP生成器——元音使用振荡器,辅音使用噪声生成器——实现具有可控参数的直接音频合成。
- 训练过程中使用真实音高轮廓代替学习到的推理过程,以隔离网络对其他可变因素建模的能力。
- 该架构在神经网络中集成固定且可微分的DSP操作,支持端到端优化,同时保持控制变量的可解释性。
- 系统支持文本到语音流水线以及通过修改控制变量后处理生成的音频片段,实现直接操控。
- 模型采用可微分损失函数进行端到端训练,推理时通过将控制变量输入DSP生成器以生成波形。
实验结果
研究问题
- RQ1可微分DSP能否有效应用于语音合成,以实现对音高、节奏、音量和音色等可变因素的解耦控制?
- RQ2基于DDSP的神经声码器是否能在保持快速推理速度和小模型尺寸的同时,实现高感知质量?
- RQ3能否在声码器级别而非TTS流水线早期实现有效控制,从而提升兼容性并支持事后编辑?
- RQ4与WaveGlow和WaveNet等最先进神经声码器相比,该模型在速度、模型大小和音频质量方面的表现如何?
- RQ5该模型的控制变量在多大程度上可用于生成同一语句的自然语音变体?
主要发现
- 所提出的基于DDSP的神经声码器在时长大于2秒的音频片段上实现了接近40倍实时的合成速度,长序列下优于WaveGlow的推理速度。
- 模型在单张GPU上仅用2.5天即完成收敛,显著快于WaveNet(4–5天)和WaveGlow(10+天),展现出高效的训练效率。
- 模型仅含490万个参数,远小于WaveGlow的8780万个参数,与WaveNet规模相当,适合边缘设备部署。
- 模型在MUSHRA评分中取得中位数40分(满分100分),表明感知质量中等,主要限制在于辅音听起来不自然,尽管音色建模良好。
- Griffin–Liman算法也达到了相似的MUSHRA评分,但原因不同:本模型的辅音为人工生成,而Griffin–Liman的误差源于相位估计偏差,凸显了一维质量指标的局限性。
- 该模型可在声码器级别直接控制音高及其他可变因素,支持对音频进行事后编辑,而无需重新训练或修改频谱图生成器。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。