[论文解读] TalkNet 2: Non-Autoregressive Depth-Wise Separable Convolutional Model for Speech Synthesis with Explicit Pitch and Duration Prediction
TalkNet 2 提出了一种非自回归、完全卷积的文本到语音模型,采用逐通道可分离卷积显式预测音素时长和音高,实现了快速、准确且鲁棒的语音合成。其参数量仅为 13.2M,接近当前最先进模型的两倍小,同时在批量大小为 1 时实现 132 倍实时推理速度,MOS 得分为 4.08。
We propose TalkNet, a non-autoregressive convolutional neural model for speech synthesis with explicit pitch and duration prediction. The model consists of three feed-forward convolutional networks. The first network predicts grapheme durations. An input text is expanded by repeating each symbol according to the predicted duration. The second network predicts pitch value for every mel frame. The third network generates a mel-spectrogram from the expanded text conditioned on predicted pitch. All networks are based on 1D depth-wise separable convolutional architecture. The explicit duration prediction eliminates word skipping and repeating. The quality of the generated speech nearly matches the best auto-regressive models - TalkNet trained on the LJSpeech dataset got MOS 4.08. The model has only 13.2M parameters, almost 2x less than the present state-of-the-art text-to-speech models. The non-autoregressive architecture allows for fast training and inference. The small model size and fast inference make the TalkNet an attractive candidate for embedded speech synthesis.
研究动机与目标
- 通过用显式时长预测替代基于注意力的对齐机制,解决自回归 TTS 模型中的词语遗漏和重复问题。
- 通过在梅尔频谱图生成阶段消除自回归生成,实现快速、并行的训练与推理。
- 在保持与当前最先进自回归模型相当的高语音质量的同时,减小模型大小和计算成本。
- 通过将这些韵律特征与主生成过程解耦,提升对语音时长和音高的可控性。
- 开发一种轻量化、高效的 TTS 系统,适用于资源受限的嵌入式设备部署。
提出的方法
- 使用一维逐通道可分离卷积网络从输入文本中预测音素时长,替代基于注意力的对齐机制。
- 根据预测的时长将输入文本展开,重复每个音素,生成时长效准序列。
- 应用第二个逐通道可分离卷积网络,为展开序列中的每个帧预测音高值。
- 训练第三个逐通道可分离卷积网络,基于展开的文本和预测的音高生成梅尔频谱图。
- 利用基于 CTC 的 ASR 模型进行 Viterbi 解码,获取训练时长预测器的精确真实标签对齐。
- 使用独立的外部声码器(WaveGlow 或 HiFi-GAN)从生成的梅尔频谱图合成语音。
实验结果
研究问题
- RQ1在非自回归 TTS 模型中,显式时长预测是否能有效消除对注意力机制的依赖,从而避免词语遗漏和重复?
- RQ2完全卷积的、逐通道可分离的架构在减小模型规模的同时,能否实现与 Tacotron 2 等自回归模型相当的语音质量?
- RQ3与自回归基线相比,非自回归 TTS 模型的推理速度如何随批量大小变化?
- RQ4使用 Viterbi 解码的 CTC 对齐提取方法是否能提供比贪婪解码更准确的时长监督?
- RQ5在非自回归 TTS 系统中,模型效率(参数量、推理速度)与语音质量之间的权衡如何?
主要发现
- 当与 HiFi-GAN 声码器结合时,TalkNet 在 LJSpeech 数据集上的平均意见得分(MOS)达到 4.08,几乎与 Tacotron 2(4.20)和 FastPitch(4.13)的质量相当。
- 该模型仅包含 13.2 百万个参数,约为当前最先进模型(如 FastSpeech 30.1M 和 Tacotron-2 28.2M)的一半。
- 在 V100 GPU 上,批量大小为 1 时推理速度达到实时的 132 倍;批量大小为 32 时,速度提升至 2531 倍,展现出极佳的可扩展性。
- 显式时长预测器的准确率达到 81%,在绝对时长误差为 1 帧以内的范围内覆盖了 95% 的类别,显著减少了词语遗漏和重复。
- 该模型对困难测试句子具有鲁棒性:完全消除了词语遗漏和重复现象,而 Tacotron 2 等自回归模型则无法做到。
- 在配备 8 块 V100 GPU 的 DGX-1 服务器上训练完整模型耗时不足 2 小时,其中时长预测训练仅需 11 分钟,梅尔频谱图生成部分耗时不足 2 小时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。