[论文解读] DeviceTTS: A Small-Footprint, Fast, Stable Network for On-Device Text-to-Speech
DeviceTTS 提出了一种轻量化、快速且稳定的端到端文本到语音模型,专为设备端部署而优化。它使用时长预测器来稳定对齐,采用 DFSMN 模块实现高效建模,并引入混合分辨率解码器以在计算成本极低的情况下提升语音质量,仅用 140 万个参数和 0.099 GFLOPS 的计算量即实现了接近最先进水平的语音质量。
With the number of smart devices increasing, the demand for on-device text-to-speech (TTS) increases rapidly. In recent years, many prominent End-to-End TTS methods have been proposed, and have greatly improved the quality of synthesized speech. However, to ensure the qualified speech, most TTS systems depend on large and complex neural network models, and it's hard to deploy these TTS systems on-device. In this paper, a small-footprint, fast, stable network for on-device TTS is proposed, named as DeviceTTS. DeviceTTS makes use of a duration predictor as a bridge between encoder and decoder so as to avoid the problem of words skipping and repeating in Tacotron. As we all know, model size is a key factor for on-device TTS. For DeviceTTS, Deep Feedforward Sequential Memory Network (DFSMN) is used as the basic component. Moreover, to speed up inference, mix-resolution decoder is proposed for balance the inference speed and speech quality. Experiences are done with WORLD and LPCNet vocoder. Finally, with only 1.4 million model parameters and 0.099 GFLOPS, DeviceTTS achieves comparable performance with Tacotron and FastSpeech. As far as we know, the DeviceTTS can meet the needs of most of the devices in practical application.
研究动机与目标
- 解决因模型过大和推理成本过高而导致在资源受限设备上部署高质量 TTS 的挑战。
- 通过引入时长预测器作为编码器与解码器之间的桥梁,克服 Tacotron 中常见的单词跳过和重复等问题,提升稳定性。
- 在保持高质量语音的同时,减小模型大小并降低推理延迟,以满足实际设备端应用的需求。
- 通过一种新颖的混合分辨率解码器架构,优化速度与质量之间的权衡。
- 证明小型高效模型可在设备端实现与 Tacotron 和 FastSpeech 等大型模型相当的性能。
提出的方法
- 采用时长预测器预测每个音素对应的帧数,以稳定对齐,避免注意力机制模型中常见的单词跳过或重复现象。
- 使用深度前馈序列记忆网络(DFSMN)作为核心构建模块,实现高效、低参数量的建模,并具备强大的序列表征学习能力。
- 提出一种混合分辨率解码器,先并行预测多个声学帧(r > 1),再通过轻量级自回归网络对结果进行精细化处理,以提升语音质量。
- 通过多帧并行预测加速推理过程,同时借助精炼步骤保持语音自然度。
- 采用重建损失与时长预测损失相结合的方式训练模型,以同时优化声学特征与对齐质量。
- 使用 WORLD 和 LPCNet 语音合成器将预测的声学特征转换为高保真语音,支持在不同语音合成器类型下进行评估。
实验结果
研究问题
- RQ1小型高效的 TTS 模型是否能在设备端部署的前提下,实现与 Tacotron 和 FastSpeech 等复杂大型模型相当的语音质量?
- RQ2时长预测器在稳定对齐、防止端到端 TTS 中出现单词跳过或重复方面有多有效?
- RQ3DFSMN 模块在保持极低参数量的同时,能在多大程度上替代更大的注意力机制或 Transformer 模块,且不损失性能?
- RQ4在低资源模型中,混合分辨率解码器是否能在不显著增加计算成本的前提下提升语音质量?
- RQ5在混合分辨率解码器中,自回归精炼步骤是否能在质量与延迟方面优于非自回归替代方案?
主要发现
- DeviceTTS 在 LPCNet 语音合成器下取得 4.255 的平均意见评分(MOS),在 WORLD 语音合成器下取得 4.193 的 MOS,表明其语音自然度接近最先进水平。
- 仅使用 140 万个参数和 0.099 GFLOPS 的计算量,DeviceTTS 显著小于 Tacotron(1350 万个参数,0.491 GFLOPS)和 FastSpeech(3610 万个参数,8.58 GFLOPS)。
- 消融实验表明,若移除混合分辨率解码器,CMOS 降低 0.254,证实其在提升语音质量方面起着关键作用。
- 混合分辨率解码器中的自回归精炼网络相比非自回归方案,将首帧推理成本降低 60%,且仅导致 0.003 的 MOS 下降,影响可忽略。
- DeviceTTS 在长语音样本上保持稳定性能,在未见过的序列长度上泛化能力优于 FastSpeech。
- 该模型参数量小、计算成本低,适用于绝大多数消费级设备部署,完全满足实际设备端 TTS 的应用需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。