[论文解读] Semi-Supervised Training for Improving Data Efficiency in End-to-End Speech Synthesis
本文提出了一种半监督训练框架,通过利用未配对的文本和语音语料,提升端到端文本到语音(TTS)模型的数据效率。该方法在Tacotron编码器中引入预训练词向量,并对解码器在未配对语音上进行预训练,使得仅使用不到30分钟的配对训练数据即可生成可懂的语音——显著提升了数据效率。
Although end-to-end text-to-speech (TTS) models such as Tacotron have shown excellent results, they typically require a sizable set of high-quality pairs for training, which are expensive to collect. In this paper, we propose a semi-supervised training framework to improve the data efficiency of Tacotron. The idea is to allow Tacotron to utilize textual and acoustic knowledge contained in large, publicly-available text and speech corpora. Importantly, these external data are unpaired and potentially noisy. Specifically, first we embed each word in the input text into word vectors and condition the Tacotron encoder on them. We then use an unpaired speech corpus to pre-train the Tacotron decoder in the acoustic domain. Finally, we fine-tune the model using available paired data. We demonstrate that the proposed framework enables Tacotron to generate intelligible speech using less than half an hour of paired training data.
研究动机与目标
- 为解决端到端TTS模型(如Tacotron)对高数据量的需求,这些模型需要大量昂贵的配对文本-语音数据。
- 通过利用大规模、公开的、未配对的文本和语音语料,在低资源TTS场景中提升数据效率。
- 探索在外部未配对数据上进行无监督预训练,如何促进编码器和解码器的表征学习。
- 评估半监督训练在降低生成可懂语音所需最低数据阈值方面的有效性。
- 为将外部来源的文本和声学知识整合到端到端TTS模型中,提供设计指导。
提出的方法
- 通过在编码器输入或编码器顶层拼接或逐元素相加的方式,将预训练词向量条件化到Tacotron编码器上,采用两种条件化方法:拼接和逐元素相加。
- 使用未配对语音语料对Tacotron解码器进行预训练,以无监督方式学习声学表征,随后在少量配对数据上进行微调。
- 利用来自预训练神经语言模型(NNLM)的词向量,将语义和句法知识注入编码器,即使在配对数据有限的情况下也能改善文本表征。
- 采用Griffin-Lim作为波形重建方法,以加速训练和评估周期,重点在于数据效率而非音频保真度。
- 仅使用少量配对数据对完整模型进行微调,以学习文本与声学表征之间的对齐。
- 评估不同配置:仅编码器(T-Enc)、仅解码器(T-Dec)和联合(T-Enc-Dec)条件化,通过MCD和主观测试比较性能。
实验结果
研究问题
- RQ1预训练词向量能否显著提升Tacotron等端到端TTS模型的数据效率?
- RQ2在未配对语音上预训练解码器是否能提升在极少量配对数据下的对齐学习与语音质量?
- RQ3在半监督TTS框架中,如何最优地结合来自未配对数据的文本与声学知识?
- RQ4当在极少量配对数据(如30分钟以下)上训练时,半监督Tacotron的性能与标准基线相比如何?
- RQ5所提出的框架能否在少于半小时的配对训练数据下生成可懂语音?
主要发现
- 所提出的半监督框架使Tacotron仅使用24分钟配对训练数据即可生成可懂语音,显著降低了数据需求。
- T-Dec(解码器预训练)在所有变体中MCD最低(12.09),表明其从未配对语音中学习到更优的声学表征。
- 在主观测试中,T-Enc和T-Dec均显著优于基线T-Base,超过60%的评分者更偏好它们而非基线。
- 并排主观测试显示,T-Enc、T-Dec和T-Enc-Dec之间无明显偏好,表明尽管预训练策略不同,其感知质量相当。
- 半监督模型与基线之间的性能差距在12分钟配对数据时最大,证实该框架在低数据场景下收益最大。
- 在所有数据量下,该框架的MCD均低于基线,表明其优势不仅限于数据效率,还可能体现在语音韵律或鲁棒性方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。