[论文解读] TalkNet: Fully-Convolutional Non-Autoregressive Speech Synthesis Model
TalkNet 是一种完全卷积、非自回归的文本到语音模型,通过音素持续时间预测器和梅尔频谱图生成器实现快速、高质量的语音合成。它通过显式预测持续时间,消除了词语跳过和重复的问题,仅使用 1080 万个参数便实现了接近最先进水平的语音质量——参数量仅为 Tacotron 2 和 FastSpeech 等模型的三倍,同时显著提升了训练和推理速度。
We propose TalkNet, a convolutional non-autoregressive neural model for speech synthesis. The model consists of two feed-forward convolutional networks. The first network predicts grapheme durations. An input text is expanded by repeating each symbol according to the predicted duration. The second network generates a mel-spectrogram from the expanded text. To train a grapheme duration predictor, we add the grapheme duration to the training dataset using a pre-trained Connectionist Temporal Classification (CTC)-based speech recognition model. The explicit duration prediction eliminates word skipping and repeating. Experiments on the LJSpeech dataset show that the speech quality nearly matches auto-regressive models. The model is very compact -- it has 10.8M parameters, almost 3x less than the present state-of-the-art text-to-speech models. The non-autoregressive architecture allows for fast training and inference.
研究动机与目标
- 为解决自回归 TTS 模型的局限性,包括因注意力机制失效导致的词语跳过和重复问题,以及推理速度慢的问题。
- 消除对自回归解码和注意力机制的依赖,以提升训练和推理速度。
- 开发一种紧凑且参数高效的 TTS 系统,在无需教师模型的情况下保持高语音质量。
- 通过显式持续时间预测,实现对语调和语速的显式控制。
- 利用预训练的 CTC 基础 ASR 模型提取的对齐信息进行持续时间预测器的训练,避免对额外对齐标注的依赖。
提出的方法
- 该模型使用两个全卷积的前馈网络:音素持续时间预测器和梅尔频谱图生成器。
- 输入文本首先通过持续时间预测器,输出每个音素的预测持续时间。
- 随后,输入文本根据预测的持续时间被扩展,即每个字符按其持续时间重复,形成时间对齐的序列。
- 扩展后的序列被输入到梅尔频谱图生成器中,以非自回归方式生成最终的梅尔频谱图。
- 持续时间预测通过从预训练的 CTC 基础 ASR 模型中提取的对齐信息进行训练,提供音素到音频的真值对齐监督。
- 训练过程中应用持续时间增强,以提高对持续时间预测误差的鲁棒性。
实验结果
研究问题
- RQ1完全卷积、非自回归的 TTS 模型能否实现与 Tacotron 2 等自回归模型相当的语音质量?
- RQ2显式持续时间预测是否能有效消除对注意力机制的依赖,从而避免词语跳过和重复?
- RQ3参数量少于 1100 万个的紧凑型 TTS 模型能否达到最先进大模型的性能水平?
- RQ4与自回归基线相比,非自回归架构在训练和推理速度方面提升了多少?
- RQ5预训练的 CTC 基础 ASR 模型能否提供足够的对齐监督,以在无需额外标注的情况下训练出高质量的持续时间预测器?
主要发现
- TalkNet 在 LJSpeech 数据集上的平均意见评分(MOS)为 3.74 ± 0.07,与 Tacotron 2 的 3.85 ± 0.06 非常接近。
- 该模型将词语跳过和重复问题降低至接近零水平,在困难测试句子上优于 Tacotron 2 和 Transformer-TTS 等自回归模型。
- 在 V100 GPU 上,推理延迟为每样本 0.019 秒,实时因子(RTF)达到 328.65,显著快于 Tacotron 2(RTF 7.56)和 FastSpeech(RTF 221.01)。
- 在 8 张 V100 GPU 上以混合精度训练,训练时间约为 2 小时,远快于同类模型。
- TalkNet 仅包含 1080 万个参数,约为 Tacotron 2(2820 万)和 FastSpeech(3010 万)的三分之一,展现出极高的参数效率。
- 由于训练中使用了持续时间增强,模型对持续时间预测误差具有鲁棒性,提升了泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。