[论文解读] Unsupervised Data Selection for TTS: Using Arabic Broadcast News as a Case Study
本论文提出了一套完全无监督的框架,用于利用阿拉伯语广播新闻构建低资源文本到语音(TTS)系统,通过DNSMOS自动数据筛选、元音化处理以及自动语音识别(ASR)进行转录校正。通过仅使用一小时精选数据,对非自回归FastSpeech2模型进行微调,并由预训练的自回归TTS模型进行指导,该方法在可懂性方面达到4.4分,在自然度方面达到4.2分,优于更大规模的数据集,原因在于数据质量的提升和高效的训练策略。
Several high-resource Text to Speech (TTS) systems currently produce natural, well-established human-like speech. In contrast, low-resource languages, including Arabic, have very limited TTS systems due to the lack of resources. We propose a fully unsupervised method for building TTS, including automatic data selection and pre-training/fine-tuning strategies for TTS training, using broadcast news as a case study. We show how careful selection of data, yet smaller amounts, can improve the efficiency of TTS system in generating more natural speech than a system trained on a bigger dataset. We adopt to propose different approaches for the: 1) data: we applied automatic annotations using DNSMOS, automatic vowelization, and automatic speech recognition (ASR) for fixing transcriptions' errors; 2) model: we used transfer learning from high-resource language in TTS model and fine-tuned it with one hour broadcast recording then we used this model to guide a FastSpeech2-based Conformer model for duration. Our objective evaluation shows 3.9% character error rate (CER), while the groundtruth has 1.3% CER. As for the subjective evaluation, where 1 is bad and 5 is excellent, our FastSpeech2-based Conformer model achieved a mean opinion score (MOS) of 4.4 for intelligibility and 4.2 for naturalness, where many annotators recognized the voice of the broadcaster, which proves the effectiveness of our proposed unsupervised method.
研究动机与目标
- 为解决阿拉伯语低资源TTS中高质量配对文本-语音数据稀缺的问题,利用广泛可用但质量较低的广播新闻录音。
- 开发一个完全无监督的数据筛选流程,以自动指标(如DNSMOS)和ASR-based错误校正替代昂贵的人工标注。
- 通过在原始转录中应用元音化处理并利用来自高资源语言的迁移学习,提升TTS的质量与效率。
- 证明:通过自动化方法筛选出的更小但质量更高的数据集,其TTS性能优于更大但噪声更多的数据集。
- 通过最小的人工干预和现有语音语料库,实现低资源语言的高效、可复现的TTS训练。
提出的方法
- 利用DNSMOS自动筛选音频片段,按质量排序,以可扩展、客观的指标替代人工标注。
- 对原始转录应用自动元音化处理,将字符错误率(CER)从32.2%降低至3.9%。
- 利用自动语音识别(ASR)对广播新闻数据中的转录错误进行校正。
- 从高资源语言(如英语)迁移学习,预训练一个自回归TTS模型(Tacotron2),该模型随后指导一个基于非自回归FastSpeech2的Conformer模型。
- 仅使用一小时高质量、自动筛选的广播新闻数据,对非自回归模型进行微调。
- 应用基于WaveNet的神经声码器(PWG)以提升最终合成语音的自然度。
实验结果
研究问题
- RQ1自动指标(如DNSMOS)能否在低资源TTS中实现与专家人工标注相当的数据筛选性能?
- RQ2在阿拉伯语原始未元音化转录上应用元音化处理,能在多大程度上提升TTS性能?
- RQ3从高资源语言迁移学习是否能显著降低阿拉伯语高质量TTS系统训练的数据需求?
- RQ4与更大但噪声更多的数据集相比,通过无监督方法筛选出的更小、更高质量数据集,在语音自然度和可懂性方面是否表现更优?
- RQ5基于预训练自回归教师模型指导的非自回归TTS模型,是否能在仅用一小时微调数据的情况下实现高MOS评分?
主要发现
- 所提出的无监督数据筛选方法(DNSMOS)实现了4.0%的CER,几乎与人工筛选的3.9% CER相当,证明了自动指标的高可靠性。
- 元音化处理将CER从32.2%降低至3.9%,显著提升了转录质量,从而改善了TTS性能。
- 基于FastSpeech2的Conformer模型在可懂性方面达到4.4分,在自然度方面达到4.2分,表明尽管仅使用一小时微调数据,仍能实现接近优秀水平的语音质量。
- 真实录音在可懂性和自然度方面均达到4.9分,表明人类听者能轻松识别播音员声音,验证了合成语音的感知质量。
- 应用神经声码器(PWG)后,自然度和可懂性均得到提升,MOS分别达到4.4和4.2,证实了高保真声码器在非自回归TTS中的优势。
- 在减少因子为1且应用元音化处理的模型(7V)优于减少因子更高的模型,表明更快的推理并不总能提升质量,数据质量比速度更为关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。