[논문 리뷰] JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis
본 논문은 엔드-투-엔드 음성 합성을 위해 모든 일상용 한자 발음을 다루도록 설계된 자유로운 10시간 분량의 일본어 음성 데이터셋인 JSUT 코퍼스를 소개하며, 아홉 개의 서브-코퍼스 및 공개 리소스를 제공합니다.
Thanks to improvements in machine learning techniques including deep learning, a free large-scale speech corpus that can be shared between academic institutions and commercial companies has an important role. However, such a corpus for Japanese speech synthesis does not exist. In this paper, we designed a novel Japanese speech corpus, named the "JSUT corpus," that is aimed at achieving end-to-end speech synthesis. The corpus consists of 10 hours of reading-style speech data and its transcription and covers all of the main pronunciations of daily-use Japanese characters. In this paper, we describe how we designed and analyzed the corpus. The corpus is freely available online.
연구 동기 및 목표
- 무료하고 대규모의 일본어 음성 코퍼스를 엔드-투-엔드 음성합성 연구를 위해 제공한다.
- 일상용 일본어 글자의 모든 발음과 개별 읽기 표기를 보장한다.
- 차용어, 의역 변형, 여행/전례 콘텐츠 등 다양한 도메인을 포함한다.
제안 방법
- 일상용 한자 문자의 주요 발음과 읽기를 다루는 아홉 개의 서브-코퍼스를 설계한다.
- Wikipedia와 TANAKA 코퍼스로부터 5000문장을 선택하고 수동으로 추가한 문장들로 basic5000을 구성한다.
- 카운터 접미사, 차용어, 의역 및 도메인 특화 콘텐츠를 포함한 발화를 크라우드소싱 또는 수집한다.
- 성우 코퍼스의 para-말하기와 의성어 문장을 도입하여 어조를 풍부하게 한다.
- 48 kHz의 무반향실에서 원어민 여성 화자의 읽기 음성을 10시간 녹음한다.
- 음절 수, 발화당 단어 수 등 언어 통계 및 F0 변화량을 일자별로 분석하고 주석화한다.
실험 결과
연구 질문
- RQ1일상용 한자 발음의 모든 발음을 포괄하는 자유롭게 접근 가능한 일본어 음성 코퍼스를 엔드-투-엔드 TTS를 위해 구축할 수 있는가?
- RQ2도메인 차이(차용어, 의역, 여행, 전례 등)가 데이터 다양성 및 발음 커버리지에 어떤 영향을 주는가?
- RQ3구성된 JSUT 코퍼스의 언어학적 및 음성 통계는 무엇이며 녹음 일수에 따라 어떻게 달라지는가?
주요 결과
- JSUT 코퍼스는 다양한 언어적 내용을 가진 아홉 개의 서브-코퍼스와 10시간의 음성 데이터를 포함한다.
- basic5000 서브-코퍼스는 일상용 한자 문자의 주요 발음을 모두 대상으로 한다.
- 코퍼스에는 차용어, 의역 변형, 의성어 및 도메인 특화 문장이 포함되어 커버리지를 넓힌다.
- 음성 데이터는 48 kHz의 무반향실에서 원어민 여성 화자로부터 녹음되었다.
- 코퍼스는 UTF-8 텍스트와 16비트 WAV 음성 데이터를 제공하며 온라인에서 자유롭게 이용 가능하다.
- 분석은 발화 길이의 범위와 녹음 일수에 따른 평균 로그 F0의 증가를 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.