[论文解读] JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis
本论文介绍 JSUT 语料库,这是一个免费的 10 小时日语语音数据集,旨在覆盖日常使用汉字的所有读音,用于端到端语音合成,包含九个子语料库和公开可用资源。
Thanks to improvements in machine learning techniques including deep learning, a free large-scale speech corpus that can be shared between academic institutions and commercial companies has an important role. However, such a corpus for Japanese speech synthesis does not exist. In this paper, we designed a novel Japanese speech corpus, named the "JSUT corpus," that is aimed at achieving end-to-end speech synthesis. The corpus consists of 10 hours of reading-style speech data and its transcription and covers all of the main pronunciations of daily-use Japanese characters. In this paper, we describe how we designed and analyzed the corpus. The corpus is freely available online.
研究动机与目标
- 提供一个免费的、大规模的日语语音语料库,用于端到端语音合成研究。
- 确保覆盖日常使用的日语汉字的所有读音及独立的读音读法。
- 包括借用词、改述变体以及旅行/前例等领域内容。
提出的方法
- 设计九个子语料库,以覆盖日常使用汉字的主要读音与读法。
- 通过从 Wikipedia 和 TANAKA 语料库中选取 5000 句子并加上人工添加的句子,构建 basic5000。
- 众包或收集包括计数后缀、借词、改述和领域特定内容的说话样本。
- 将来自女优语料库的拟声语音与拟声词句子结合,以丰富韵律。
- 在消声室中以 48 kHz 采样率由母语女性说话者录制 10 小时的朗读语音。
- 对音节等语言统计量并分析每句的词数,以及跨日记录 F0 的变化。
实验结果
研究问题
- RQ1是否可以构建一个自由获取的日语语音语料库,以覆盖日常使用的汉字的所有读音用于端到端的 TTS?
- RQ2领域变异(借词、改述、旅行、前例等)如何影响数据多样性和发音覆盖范围?
- RQ3构建的 JSUT 语料库的语言与语音统计有哪些,以及它们在不同录制日之间如何变化?
主要发现
- JSUT 语料库由具多样语言内容的九个子语料库和 10 小时的语音数据组成。
- basic5000 子语料库覆盖日常使用汉字的所有主要读音。
- 语料库包括借词、改述变体、拟声词和领域特定句子以扩大覆盖范围。
- 语音数据在消声室以 48 kHz 采样率由母语女性说话者录制。
- 语料库提供 UTF-8 文本和 16 位 WAV 语音数据,且可以在网上免费获取。
- 分析显示话语长度范围及在录制日之间观测到的平均 log F0 的增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。