Skip to main content
QUICK REVIEW

[论文解读] JVS corpus: free Japanese multi-speaker voice corpus

Shinnosuke Takamichi, Kentaro Mitsui|arXiv (Cornell University)|Aug 17, 2019
Speech Recognition and Synthesis参考文献 16被引用 41
一句话总结

本文介绍了 JVS 语料库,这是一个免费的 30 小时日语多说话人语音数据集,分为四个子语料库(parallel100、nonpara30、whisper10、falsetto10),用于多说话人和多风格语音研究。

ABSTRACT

Thanks to improvements in machine learning techniques, including deep learning, speech synthesis is becoming a machine learning task. To accelerate speech synthesis research, we are developing Japanese voice corpora reasonably accessible from not only academic institutions but also commercial companies. In 2017, we released the JSUT corpus, which contains 10 hours of reading-style speech uttered by a single speaker, for end-to-end text-to-speech synthesis. For more general use in speech synthesis research, e.g., voice conversion and multi-speaker modeling, in this paper, we construct the JVS corpus, which contains voice data of 100 speakers in three styles (normal, whisper, and falsetto). The corpus contains 30 hours of voice data including 22 hours of parallel normal voices. This paper describes how we designed the corpus and summarizes the specifications. The corpus is available at our project page.

研究动机与目标

  • 为语音合成、语音转换和多说话人建模等研究与开发提供一个大型、 高质量的日语多说话人语音语料库。
  • 提供平行与非平行的语音数据,以支持如语音转换、说话人因子分解以及多说话人建模等多样化任务。
  • 通过详尽的标注、许可说明和易于下载的格式,确保可访问性和完善的文档。
  • 在明确的许可条款下,支持学术和商业研究用途。

提出的方法

  • 设计四个子语料库,每位说话人具有指定的发声计数:parallel100(100 条平行普通话),nonpara30(30 条非平行普通话),whisper10(10 条 whisper 发声),以及 falsetto10(10 条假声发声)。
  • 在录音室以 24 kHz、16-bit RIFF WAV 录制 100 名母语日语专业说话人,附带 UTF-8 转写和音素对齐。
  • 自动生成全上下文和单音素标签(Open JTalk)并对齐音素(Julius),并对每位说话人手动标注 F0 范围。
  • 提供额外标签:说话人相似性矩阵、时长数据,以及按说话人分组的性别与 F0 范围信息。
  • 使语料库在清晰许可条款下自由用于研究,供学术和商业用途。
  • 包括转写、音素对齐以及与说话人相关的元数据,以促进如语音转换和多说话人建模等任务。

实验结果

研究问题

  • RQ1JVS 语料库的结构与覆盖范围是什么,它如何支持多说话人与多风格语音研究?
  • RQ2JVS 语料库的规格(说话人、发声片段、风格、标注)是什么,数据如何组织?
  • RQ3每个子语料库和每位说话人数据量是多少,录音/标注流程是什么?
  • RQ4JVS 语料库如何支撑如语音转换、说话人建模和风格适应等研究任务?
  • RQ5在不同研究语境下,支配 JVS 语料库使用的许可与可访问性条款是什么?

主要发现

  • JVS 语料库由 100 名母语日语专业说话人组成,跨四个子语料库的数据量约 30 小时。
  • Parallel100 每位说话人包含 100 个发声片段,而 nonpara30、whisper10、falsetto10 增加非平行且风格多样的数据,总计 30.4 小时。
  • 每位说话人普通语音的平均时长约 15.7 分钟,大约每位说话人 1.24 分钟的 whisper 和 1.18 分钟的 falsetto。
  • 说话人 F0 范围是人工注释,并提供感知说话人相似性矩阵以进行跨说话人分析。
  • 音频为 24 kHz、16-bit RIFF WAV,采用 OpenJTalk 与 Julius 基于标注流程以实现完整标注。
  • 该语料库对学术和商业研究免费开放,项目页许可条款详述商业用途。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。