[论文解读] LRSpeech: Extremely Low-Resource Speech Synthesis and Recognition
LRSpeech 提出了一种低数据量解决方案,用于在极低资源语言中实现文本到语音(TTS)和自动语音识别(ASR),该方案采用预训练、TTS 与 ASR 之间的双向转换以及知识蒸馏技术。在仅使用 1.29 小时配对数据的情况下,Lithuanian 语言的 TTS 可实现 98.6% 的可懂度和 3.65 的 MOS 分数,ASR 的 WER 为 17.04%,证明了其在稀有语言中的工业可行性。
Speech synthesis (text to speech, TTS) and recognition (automatic speech recognition, ASR) are important speech tasks, and require a large amount of text and speech pairs for model training. However, there are more than 6,000 languages in the world and most languages are lack of speech training data, which poses significant challenges when building TTS and ASR systems for extremely low-resource languages. In this paper, we develop LRSpeech, a TTS and ASR system under the extremely low-resource setting, which can support rare languages with low data cost. LRSpeech consists of three key techniques: 1) pre-training on rich-resource languages and fine-tuning on low-resource languages; 2) dual transformation between TTS and ASR to iteratively boost the accuracy of each other; 3) knowledge distillation to customize the TTS model on a high-quality target-speaker voice and improve the ASR model on multiple voices. We conduct experiments on an experimental language (English) and a truly low-resource language (Lithuanian) to verify the effectiveness of LRSpeech. Experimental results show that LRSpeech 1) achieves high quality for TTS in terms of both intelligibility (more than 98% intelligibility rate) and naturalness (above 3.5 mean opinion score (MOS)) of the synthesized speech, which satisfy the requirements for industrial deployment, 2) achieves promising recognition accuracy for ASR, and 3) last but not least, uses extremely low-resource training data. We also conduct comprehensive analyses on LRSpeech with different amounts of data resources, and provide valuable insights and guidances for industrial deployment. We are currently deploying LRSpeech into a commercialized cloud speech service to support TTS on more rare languages.
研究动机与目标
- 解决超过 6,000 种低资源和稀有语言在 TTS 和 ASR 系统中缺乏语音训练数据的问题。
- 开发一种可扩展、低成本的解决方案,支持极低资源语言的工业级部署。
- 在仅使用极少配对数据并利用未配对语音和跨任务知识的前提下,提升 TTS 和 ASR 的性能。
- 实现在商业云平台中为稀有语言部署 TTS 和 ASR 服务。
提出的方法
- 在高资源语言上进行预训练,随后在低资源语言上微调,以迁移语言和声学知识。
- 在 TTS 和 ASR 之间进行双向转换,每个模型生成伪配对数据,以迭代方式相互提升。
- 通过知识蒸馏,将 TTS 适配到目标说话人的语音,并提升 ASR 在多说话人场景下的鲁棒性。
- 利用来自已见和未见说话人的未配对语音数据,以增强模型的泛化能力。
- 利用未配对的文本和合成语音,通过自监督学习进一步提升模型性能。
- 将多说话人的低质量未配对语音与极少的配对数据结合,以最大化数据效率。
实验结果
研究问题
- RQ1在低资源环境下,仅使用几分钟的配对数据,TTS 和 ASR 模型能否实现高性能?
- RQ2在监督信息极少的情况下,TTS 与 ASR 之间的双向转换在相互提升性能方面有多高效?
- RQ3从合成语音中进行知识蒸馏在多大程度上能提升低资源语言的 ASR 准确率?
- RQ4引入来自已见和未见说话人的未配对语音在多大程度上影响模型的泛化能力?
- RQ5所提出的框架能否在商业云服务中部署,以支持稀有语言?
主要发现
- LRSpeech 在 Lithuanian 上实现了 98.60% 的可懂度率和 3.65 的平均意见得分(MOS),达到工业部署标准。
- ASR 模型在仅使用 1.29 小时配对训练数据的情况下,于 Lithuanian 上实现了 17.04% 的词错误率(WER)和 10.30% 的字符错误率(CER)。
- 增加低质量配对数据的数量可提升 TTS 性能,数据量越大,准确率越高。
- 引入来自已见和未见说话人的未配对语音显著提升了 TTS 和 ASR 的准确率。
- 使用合成语音数据进行知识蒸馏可提升 ASR 性能,合成数据比例越高,结果越好。
- 该系统目前已在商业云 TTS 服务中部署,用于支持数据极少的稀有语言。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。