[论文解读] KazakhTTS2: Extending the Open-Source Kazakh TTS Corpus With More Data, Speakers, and Topics
本文提出 KazakhTTS2,一个扩展的开源文本到语音(TTS)语料库,用于哈萨克语,音频转录时长从93小时增加至271小时,涵盖五位说话人(三位女性,两位男性)以及新闻、书籍和维基百科等多种来源。该语料库支持训练高质量的神经网络TTS模型,主观平均意见得分(MOS)在3.6至4.2之间,证明其适用于实际应用场景,并推动低资源突厥语研究的发展。
We present an expanded version of our previously released Kazakh text-to-speech (KazakhTTS) synthesis corpus. In the new KazakhTTS2 corpus, the overall size has increased from 93 hours to 271 hours, the number of speakers has risen from two to five (three females and two males), and the topic coverage has been diversified with the help of new sources, including a book and Wikipedia articles. This corpus is necessary for building high-quality TTS systems for Kazakh, a Central Asian agglutinative language from the Turkic family, which presents several linguistic challenges. We describe the corpus construction process and provide the details of the training and evaluation procedures for the TTS system. Our experimental results indicate that the constructed corpus is sufficient to build robust TTS models for real-world applications, with a subjective mean opinion score ranging from 3.6 to 4.2 for all the five speakers. We believe that our corpus will facilitate speech and language research for Kazakh and other Turkic languages, which are widely considered to be low-resource due to the limited availability of free linguistic data. The constructed corpus, code, and pretrained models are publicly available in our GitHub repository.
研究动机与目标
- 为解决哈萨克语——一种低资源、黏着性突厥语——缺乏大规模、高质量、开源语音语料库的问题。
- 通过增加数据量、提升说话人多样性与话题覆盖范围,改进原始KazakhTTS语料库。
- 通过主观评估验证该语料库在训练稳健、可部署TTS系统方面的实用性。
- 通过公开数据、代码和预训练模型,支持未来在哈萨克语及其他低资源突厥语领域的研究。
提出的方法
- 从多样化来源(新闻文章、已出版书籍、维基百科内容)收集并人工转录了271小时的音频。
- 选取五位专业说话人(三位女性,两位男性),以确保音频质量与语言多样性。
- 采用Tacotron 2架构构建神经网络TTS系统,用于模型训练与评估。
- 通过众包主观评估,使用平均意见得分(MOS)评估合成语音的自然度与质量。
- 对合成输出进行详细错误分析,识别常见故障模式,如误读音与漏词。
- 通过公共GitHub仓库发布完整语料库、训练代码及预训练模型,供学术与商业用途。
实验结果
研究问题
- RQ1显著扩展并多样化TTS语料库是否能提升哈萨克语文本到语音合成的质量与鲁棒性?
- RQ2增加说话人多样性与数据量在多大程度上提升了哈萨克语合成语音的自然度与可懂度?
- RQ3不同文本来源(新闻、书籍、维基百科)如何影响TTS模型的性能与泛化能力?
- RQ4合成语音中的主要错误类型是什么?未来模型如何减轻这些错误?
- RQ5KazakhTTS2语料库能否作为其他突厥语中迁移学习与跨语言应用的基础?
主要发现
- KazakhTTS2语料库包含来自五位专业说话人、多样化来源的271小时高质量人工转录音频。
- 所有五位说话人主观平均意见得分(MOS)均在3.6至4.2之间,表明语音质量高,适合实际部署。
- 说话人M2得分最高(4.2),而F1和M1 News在先前版本中得分最高(分别为4.726和4.360)。
- 合成语音中最常见的错误类型为误读音(15起)、不完整词(14起)与漏词(14起),其中M1错误数量最多。
- 该语料库支持使用Tacotron 2训练最先进水平的TTS模型,各项评估指标与置信区间结果一致。
- 语料库、代码与预训练模型均公开发布于GitHub,支持可复现性及未来在哈萨克语及相关低资源语言研究中的应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。