[论文解读] Parallel Tacotron 2: A Non-Autoregressive Neural TTS Model with Differentiable Duration Modeling
Parallel Tacotron 2 是一种非自回归神经文本到语音(TTS)模型,通过可微分的持续时间建模和可学习的上采样机制结合辅助注意力机制,端到端地学习音素到帧的对齐关系与持续时间,无需监督的持续时间信号。该模型在主观评价中实现了最先进的自然度表现,在偏好测试中优于 Tacotron 2 和 Parallel Tacotron,同时支持可控的语速与节奏控制。
This paper introduces Parallel Tacotron 2, a non-autoregressive neural text-to-speech model with a fully differentiable duration model which does not require supervised duration signals. The duration model is based on a novel attention mechanism and an iterative reconstruction loss based on Soft Dynamic Time Warping, this model can learn token-frame alignments as well as token durations automatically. Experimental results show that Parallel Tacotron 2 outperforms baselines in subjective naturalness in several diverse multi speaker evaluations. Its duration control capability is also demonstrated.
研究动机与目标
- 解决自回归 TTS 模型的局限性,如推理速度慢以及过生成和欠生成等鲁棒性问题。
- 消除非自回归 TTS 中对外部对齐器和监督持续时间信号的依赖,以降低训练复杂度并提升模型鲁棒性。
- 实现持续时间预测与对齐学习的端到端可微训练,使梯度能够通过持续时间预测和上采样过程反向传播。
- 通过移除循环网络结构并支持现代加速器上的并行生成,提升推理速度与效率。
- 通过可学习的、可微分的持续时间建模与上采样机制,实现对语音节奏与语速的细粒度控制。
提出的方法
- 提出一种完全可微分的持续时间建模方法,能够预测连续持续时间,并支持通过四舍五入操作的梯度反向传播。
- 采用一种新颖的注意力机制,引入辅助上下文,以在不依赖真实持续时间的情况下学习音素到帧的对齐关系。
- 使用基于点积注意力的可学习上采样机制,其上下文来源于预测的持续时间与音素表征。
- 应用基于软动态时间规整(Soft-DTW)的迭代重建损失,以在无需长度匹配监督的情况下对齐预测与目标梅尔频谱图。
- 将教师强制训练替换为 Soft-DTW,以在训练期间处理长度不匹配问题,提升训练稳定性和对齐精度。
- 将持续时间建模与上采样机制整合进非自回归 TTS 框架中,实现并行生成与更快的推理速度。
实验结果
研究问题
- RQ1非自回归 TTS 模型是否能在无需监督持续时间信号或外部对齐器的情况下,学习到准确的音素到帧对齐关系与持续时间?
- RQ2与先前模型中不可微分的四舍五入操作相比,完全可微分的持续时间预测机制是否能提升对齐质量与模型性能?
- RQ3基于 Soft-DTW 的重建损失是否能有效处理训练过程中的长度不匹配问题,而无需长度匹配监督?
- RQ4该模型在多大程度上可通过学习到的持续时间调节实现对语速与节奏的可控控制?
- RQ5所提出的架构是否在自然度与推理速度方面均优于自回归模型及先前的非自回归 TTS 基线模型?
主要发现
- Parallel Tacotron 2 在主观评价中获得 4.40 ± 0.05 的平均意见得分(MOS),与 Tacotron 2 相当,但在偏好测试中得分更高,达到 0.19 ± 0.09,表现更优。
- 在 Rapid 评估集上,Parallel Tacotron 2 相对于 Tacotron 2 的偏好得分为 0.69 ± 0.16,表明其感知自然度显著更优。
- 在保留测试集上,Parallel Tacotron 2 的评分优于真实人类语音,偏好得分为 0.01 ± 0.09,表明其感知质量接近或超过人类水平。
- 该模型展示了有效的持续时间控制能力:全局语速缩放(0.75× 至 1.25×)与词级持续时间缩放(0.5× 至 1.5×)均能生成连贯且可控的语音。
- 主观评价证实,合成语音的语调特征显著优于基线模型,尤其在使用重述提示的 Rapid 数据集中表现更明显。
- 该模型通过移除循环层并实现并行生成,实现了比自回归 Tacotron 2 更快的推理速度,尽管未报告具体的速度指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。