Skip to main content
QUICK REVIEW

[论文解读] WaveNODE: A Continuous Normalizing Flow for Speech Synthesis

Hyeongju Kim, Hyeon Seung Lee|arXiv (Cornell University)|Jun 8, 2020
Speech Recognition and Synthesis参考文献 20被引用 7
一句话总结

WaveNODE 提出了一种基于连续归一化流(CNF)的神经声码器,用于语音合成,可在参数更少、无需教师网络或辅助损失项的情况下实现实时、高保真波形生成。通过利用连续时间动态和灵活的流函数,WaveNODE 仅需少量流步骤即可实现优异性能,在样本质量和训练效率方面优于传统的基于流的模型,尽管每批次的计算成本更高。

ABSTRACT

In recent years, various flow-based generative models have been proposed to generate high-fidelity waveforms in real-time. However, these models require either a well-trained teacher network or a number of flow steps making them memory-inefficient. In this paper, we propose a novel generative model called WaveNODE which exploits a continuous normalizing flow for speech synthesis. Unlike the conventional models, WaveNODE places no constraint on the function used for flow operation, thus allowing the usage of more flexible and complex functions. Moreover, WaveNODE can be optimized to maximize the likelihood without requiring any teacher network or auxiliary loss terms. We experimentally show that WaveNODE achieves comparable performance with fewer parameters compared to the conventional flow-based vocoders.

研究动机与目标

  • 开发一种内存高效的基于流的生成模型用于语音合成,避免依赖教师网络或辅助损失项。
  • 通过采用连续归一化流(CNF)来解决离散归一化流的局限性,如架构僵化和参数量过高。
  • 通过可并行采样的方式实现实时推理,克服 WaveNet 等模型的自回归瓶颈。
  • 证明基于 CNF 的模型可在更少的流步骤和更低的模型复杂度下实现具有竞争力的语音合成性能。

提出的方法

  • WaveNODE 采用连续归一化流(CNF)框架,其中隐藏状态动态由神经 ODE 建模:$ \frac{d\mathbf{z}(t)}{dt} = \mathbf{f}(\mathbf{z}(t), t) $,实现灵活、连续的变换。
  • 通过瞬时变量变换公式计算对数密度变化,利用 Hutchinson 迹估计器高效近似雅可比行列式迹。
  • 模型采用 actnorm 层以实现稳定训练,其在对数似然和 MOS 评分方面均优于批量归一化和无归一化设置。
  • 采用多尺度架构以建模长程时间依赖关系,第 $ i $ 层的膨胀因子设为 $ 3^i $,以确保足够的感受野。
  • 通过最大似然直接优化训练,无需知识蒸馏或辅助损失函数。
  • 推理过程可并行化,通过从潜在噪声向量正向求解 ODE 实现实时生成。

实验结果

研究问题

  • RQ1能否在不依赖教师网络或辅助损失项的前提下,有效将连续归一化流应用于高维、序列化的语音波形?
  • RQ2在样本质量和参数效率方面,CNF 的灵活性与离散流(如 Real NVP、IAF)相比如何?
  • RQ3归一化层(如 actnorm、MBN)对基于 CNF 的语音声码器训练稳定性和性能有何影响?
  • RQ4膨胀策略的选择如何影响基于 CNF 模型的感受野和音频质量?
  • RQ5基于 CNF 的模型能否在保持高保真波形生成的同时实现实时推理?

主要发现

  • WaveNODE 实现了 4.497 的条件对数似然(CLL)和 3.53 ± 0.18 的平均意见得分(MOS),在参数效率和训练稳定性方面优于 WaveGlow(CLL:4.501,MOS:4.17 ± 0.15)。
  • actnorm 归一化层表现最佳(CLL:4.497,MOS:3.53 ± 0.18),显著优于 MBN(CLL:4.460,MOS:3.36 ± 0.17)和无归一化设置(CLL:4.457,MOS:3.22 ± 0.17)。
  • WaveNODE 仅用 27K 次迭代(46 个周期)在 7 天内即达到良好性能,而 WaveGlow 需要 354K 次迭代(240 个周期),表明其每轮训练步骤的样本效率更高。
  • 在第 $ i $ 层使用 $ 3^i $ 的膨胀因子可获得更优的音频质量(CLL:4.497,MOS:3.53 ± 0.18),而 $ 2^i $ 胀因子导致声音颤抖且性能下降(CLL:4.408,MOS:3.17 ± 0.17)。
  • 尽管每小批量计算时间更长,但由于 CNF 的灵活性,WaveNODE 的每步训练效率更高,表现为更少周期内更快收敛。
  • 函数评估次数(NFE)在训练过程中持续增加,表明 ODE 求解器的复杂度逐渐上升,这是影响推理速度的关键挑战,也是未来优化的重点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。