[论文解读] TTS-by-TTS: TTS-driven Data Augmentation for Fast and High-Quality Speech Synthesis
本文提出 TTS-by-TTS,一种数据增强方法,利用高质量的自回归(AR)TTS 系统生成具有准确音素时长的合成文本-音频对,随后用于预训练非自回归(non-AR)TTS 模型。该方法显著提升了语音合成质量,仅使用 5 小时真实数据并增强至 179 小时合成数据,即实现 3.74 的 MOS 分数——较基线高出 40%。
In this paper, we propose a text-to-speech (TTS)-driven data augmentation method for improving the quality of a non-autoregressive (AR) TTS system. Recently proposed non-AR models, such as FastSpeech 2, have successfully achieved fast speech synthesis system. However, their quality is not satisfactory, especially when the amount of training data is insufficient. To address this problem, we propose an effective data augmentation method using a well-designed AR TTS system. In this method, large-scale synthetic corpora including text-waveform pairs with phoneme duration are generated by the AR TTS system and then used to train the target non-AR model. Perceptual listening test results showed that the proposed method significantly improved the quality of the non-AR TTS system. In particular, we augmented five hours of a training database to 179 hours of a synthetic one. Using these databases, our TTS system consisting of a FastSpeech 2 acoustic model with a Parallel WaveGAN vocoder achieved a mean opinion score of 3.74, which is 40% higher than that achieved by the conventional method.
研究动机与目标
- 在训练数据有限的情况下,提升非自回归(non-AR)文本到语音(TTS)系统的质量。
- 通过利用高保真 AR TTS 进行数据增强,弥合自回归(AR)与非自回归(non-AR)TTS 模型之间的性能差距。
- 通过保留音素时长分布的合成数据,提升非 AR TTS 模型对未见文本模式的鲁棒性与泛化能力。
- 验证 TTS 驱动的数据增强在主观质量指标上优于传统训练与知识蒸馏方法。
提出的方法
- 使用一个经过充分训练的基于 Tacotron 2 的 AR TTS 模型(配备时长预测器)作为源模型,生成合成语音。
- 通过向该源 AR TTS 模型输入多样化且保持音素分布的文本脚本,大规模生成合成的文本-音频对。
- 通过外部时长模型预测音素时长,并用于提升文本与声学特征之间的对齐准确性。
- 使用 LP-WaveNet 生成器从生成的声学特征中合成高质量波形,确保输出语音的真实性。
- 利用合成数据集对基于 FastSpeech 2 的非 AR TTS 模型进行预训练,推理阶段则结合 Parallel WaveGAN 生成器。
- 该方法无需额外真实录音即可实现数据增强,重点提升数据质量与对齐保真度。
实验结果
研究问题
- RQ1能否利用高质量 AR TTS 系统生成的合成数据,显著提升非 AR TTS 模型的质量?
- RQ2与传统训练和知识蒸馏方法相比,TTS 驱动的数据增强在感知质量方面表现如何?
- RQ3通过保留音素时长分布的合成数据增强,是否能提升模型对未见文本的泛化能力?
- RQ4当真实训练数据有限时,该方法在多大程度上缩小了 AR 与 non-AR TTS 系统之间的性能差距?
- RQ5当真实训练数据规模扩大时,该方法是否仍能保持或提升性能?
主要发现
- 所提出的 TTS-by-TTS 方法在仅使用 5 小时真实数据与 179 小时合成数据训练的非 AR TTS 系统上,取得了 3.74 的平均意见得分(MOS),较无增强的基线提升 40%。
- 当同时使用真实数据与增强数据时,非 AR TTS 系统的 MOS 达到 3.95,高于仅使用少量真实数据的 3.74 分数。
- 配备时长预测器的 AR TTS 模型在音素对齐方面优于标准注意力机制,定性分析中注意力热图更加清晰。
- 该数据增强方法提升了 Tacotron 2 模型的鲁棒性,减少了注意力崩溃现象,并改善了在未见文本上的对齐稳定性。
- 该方法通过侧重数据数量与质量,而非模型蒸馏,优于基于知识蒸馏的方案。
- 即使仅使用 5 小时真实数据,系统仍取得 3.74 的 MOS 分数,表明合成数据可有效弥补数据稀缺问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。