[논문 리뷰] JVS corpus: free Japanese multi-speaker voice corpus
논문은 JVS 코퍼스를 소개합니다. 자유로운 30시간 분량의 일본어 다중 화자 음성 데이터셋으로 네 부분의 하위 코퍼스(parallel100, nonpara30, whisper10, falsetto10)로 구성되며, 다중 화자 및 다중 스타일 음성 연구를 위해 설계되었습니다.
Thanks to improvements in machine learning techniques, including deep learning, speech synthesis is becoming a machine learning task. To accelerate speech synthesis research, we are developing Japanese voice corpora reasonably accessible from not only academic institutions but also commercial companies. In 2017, we released the JSUT corpus, which contains 10 hours of reading-style speech uttered by a single speaker, for end-to-end text-to-speech synthesis. For more general use in speech synthesis research, e.g., voice conversion and multi-speaker modeling, in this paper, we construct the JVS corpus, which contains voice data of 100 speakers in three styles (normal, whisper, and falsetto). The corpus contains 30 hours of voice data including 22 hours of parallel normal voices. This paper describes how we designed the corpus and summarizes the specifications. The corpus is available at our project page.
연구 동기 및 목표
- 연구 및 개발을 위한 대규모의 고품질 다중 화자 일본어 음성 코퍼스를 제공하여 음성 합성, 보이스 컨버전, 다중 화자 모델링 연구에 기여합니다.
- 병렬 및 비병렬 발화를 제공하여 보이스 컨버전, 화자 인자화, 다중 화자 모델링과 같은 다양한 작업을 지원합니다.
- 주석, 라이선스, 쉽게 다운로드 가능한 포맷을 통해 접근성 및 문서를 보장합니다.
- 학술 및 상용 연구 용도를 명확한 라이선스 하에 지원합니다.]
- method(
- 교정 오류로 인해
- 교정 오류로 인해
제안 방법
- 각 화자당 지정된 발화 수를 가진 네 하위 코퍼스를 설계합니다: parallel100 (100개의 병렬 정상 발화), nonpara30 (30개의 비병렬 정상 발화), whisper10 (10개의 속삭임 발화), falsetto10 (10개의 팔세토 발화).
- 24 kHz, 16-bit RIFF WAV 포맷으로 100명의 일본어 원어민 전문 화자를 스튜디오에서 녹음하며 UTF-8 전사 및 음소 정렬을 제공합니다.
- 전체 맥락 및 단음소 라벨(Open JTalk) 자동 생성 및 음소 정렬(Julius)을 수행하고, 화자별로 수동 주석 처리된 F0 범위를 제공합니다.
- 추가 태그로 화자 유사도 매트릭스, 지속 시간 데이터, 화자별 성별 및 F0 범위 정보를 제공합니다.
- 연구를 위한 자유로운 코퍼스 제공과 학술 및 상용 사용을 위한 명확한 라이선스 조건을 포함합니다.
- 전사, 음소 정렬 및 화자 관련 메타데이터를 포함하여 보이스 컨버전 및 다중 화자 모델링과 같은 작업을 촉진합니다.
실험 결과
연구 질문
- RQ1JVS 코퍼스의 구조와 범위가 다중 화자 및 다중 스타일 음성 연구를 어떻게 지원할 수 있는가?
- RQ2JVS 코퍼스의 사양(화자, 발화, 스타일, 주석)과 데이터 구성은 어떻게 되는가?
- RQ3하위 코퍼스별 및 화자별 데이터 양은 어느 정도이며 녹음/주석 파이프라인은 어떤가?
- RQ4JVS 코퍼스가 보이스 컨버전, 화자 모델링, 스타일 적응과 같은 연구 작업을 어떻게 가능하게 하는가?
- RQ5다양한 연구 맥락에서 JVS 코퍼스 사용을 지배하는 라이선스 및 접근성 조건은 무엇인가?
주요 결과
- JVS 코퍼스는 100명의 일본어 원어민 전문 화자와 약 30시간의 데이터를 네 개의 하위 코퍼스에 걸쳐 구성합니다.
- Parallel100은 화자당 100개의 발화를 포함하고, nonpara30, whisper10, falsetto10은 30.4시간의 비병렬 및 스타일 변화 데이터를 추가합니다.
- 화자당 평균 정상 음성 지속 시간은 약 15.7분이고, 화자당 대략 1.24분의 whisper와 1.18분의 falsetto가 포함됩니다.
- 화자의 F0 범위는 수동으로 주석 처리되며, 교차 화자 분석용 지각적 화자 유사도 매트릭스가 제공됩니다.
- 오디오는 24 kHz, 16-bit RIFF WAV 형식이며 전체 주석에는 OpenJTalk 및 Julius 기반 라벨링 파이프라인이 사용됩니다.
- 코퍼스는 학술 및 상용 연구에 무료로 제공되며, 프로젝트 페이지의 라이선스에 상용 사용 조건이 상세히 기술되어 있습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.