Skip to main content
QUICK REVIEW

[论文解读] JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis

Ryosuke Sonobe, Shinnosuke Takamichi|arXiv (Cornell University)|Oct 28, 2017
Speech Recognition and Synthesis参考文献 6被引用 88
一句话总结

本论文介绍 JSUT 语料库,这是一个免费的 10 小时日语语音数据集,旨在覆盖日常使用汉字的所有读音,用于端到端语音合成,包含九个子语料库和公开可用资源。

ABSTRACT

Thanks to improvements in machine learning techniques including deep learning, a free large-scale speech corpus that can be shared between academic institutions and commercial companies has an important role. However, such a corpus for Japanese speech synthesis does not exist. In this paper, we designed a novel Japanese speech corpus, named the "JSUT corpus," that is aimed at achieving end-to-end speech synthesis. The corpus consists of 10 hours of reading-style speech data and its transcription and covers all of the main pronunciations of daily-use Japanese characters. In this paper, we describe how we designed and analyzed the corpus. The corpus is freely available online.

研究动机与目标

  • 提供一个免费的、大规模的日语语音语料库,用于端到端语音合成研究。
  • 确保覆盖日常使用的日语汉字的所有读音及独立的读音读法。
  • 包括借用词、改述变体以及旅行/前例等领域内容。

提出的方法

  • 设计九个子语料库,以覆盖日常使用汉字的主要读音与读法。
  • 通过从 Wikipedia 和 TANAKA 语料库中选取 5000 句子并加上人工添加的句子,构建 basic5000。
  • 众包或收集包括计数后缀、借词、改述和领域特定内容的说话样本。
  • 将来自女优语料库的拟声语音与拟声词句子结合,以丰富韵律。
  • 在消声室中以 48 kHz 采样率由母语女性说话者录制 10 小时的朗读语音。
  • 对音节等语言统计量并分析每句的词数,以及跨日记录 F0 的变化。

实验结果

研究问题

  • RQ1是否可以构建一个自由获取的日语语音语料库,以覆盖日常使用的汉字的所有读音用于端到端的 TTS?
  • RQ2领域变异(借词、改述、旅行、前例等)如何影响数据多样性和发音覆盖范围?
  • RQ3构建的 JSUT 语料库的语言与语音统计有哪些,以及它们在不同录制日之间如何变化?

主要发现

  • JSUT 语料库由具多样语言内容的九个子语料库和 10 小时的语音数据组成。
  • basic5000 子语料库覆盖日常使用汉字的所有主要读音。
  • 语料库包括借词、改述变体、拟声词和领域特定句子以扩大覆盖范围。
  • 语音数据在消声室以 48 kHz 采样率由母语女性说话者录制。
  • 语料库提供 UTF-8 文本和 16 位 WAV 语音数据,且可以在网上免费获取。
  • 分析显示话语长度范围及在录制日之间观测到的平均 log F0 的增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。