[논문 리뷰] KazakhTTS2: Extending the Open-Source Kazakh TTS Corpus With More Data, Speakers, and Topics
이 논문은 카자흐어를 위한 확장된 오픈소스 음성합성(TTS) 코퍼스인 KazakhTTS2를 제안한다. 이 코퍼스는 뉴스, 책, 위키백과 등을 포함한 다양한 출처에서 수집한 271시간의 음성 데이터로 구성되며, 원래의 93시간에서 증가했고, 여성 3명, 남성 2명의 5명의 전문 성우가 참여하였다. 이 코퍼스를 통해 고품질의 신경망 TTS 모델을 학습시킬 수 있었으며, 주관적 평균의견점수(MOS)가 3.6에서 4.2 사이로 측정되어 실제 응용 분야에 적합함을 입증하였고, 저자원 투르크어계 언어 연구의 발전에도 기여하였다.
We present an expanded version of our previously released Kazakh text-to-speech (KazakhTTS) synthesis corpus. In the new KazakhTTS2 corpus, the overall size has increased from 93 hours to 271 hours, the number of speakers has risen from two to five (three females and two males), and the topic coverage has been diversified with the help of new sources, including a book and Wikipedia articles. This corpus is necessary for building high-quality TTS systems for Kazakh, a Central Asian agglutinative language from the Turkic family, which presents several linguistic challenges. We describe the corpus construction process and provide the details of the training and evaluation procedures for the TTS system. Our experimental results indicate that the constructed corpus is sufficient to build robust TTS models for real-world applications, with a subjective mean opinion score ranging from 3.6 to 4.2 for all the five speakers. We believe that our corpus will facilitate speech and language research for Kazakh and other Turkic languages, which are widely considered to be low-resource due to the limited availability of free linguistic data. The constructed corpus, code, and pretrained models are publicly available in our GitHub repository.
연구 동기 및 목표
- 카자흐어, 저자원이며 복합어형 투르크어계 언어인 데에 대해 대규모, 고품질, 오픈소스 음성 코퍼스의 부족을 보완하기 위함.
- 데이터 양, 성우 다양성, 주제 커버리지 측면에서 원래의 KazakhTTS 코퍼스를 향상시키기 위함.
- 주관적 평가를 통해 코퍼스의 실용성을 검증하고, 내재된 신뢰성 있는 TTS 시스템을 학습시킬 수 있도록 하기 위함.
- 데이터, 코드, 미리 학습된 모델을 공개함으로써 향후 카자흐어 및 기타 저자원 투르크어계 언어 연구를 지원하기 위함.
제안 방법
- 뉴스 기사, 출판된 책, 위키백과 콘텐츠 등 다양한 출처에서 271시간의 음성 데이터를 수집하고 수작업으로 음성 텍스트를 변환하였다.
- 고품질 음성과 언어적 다양성을 확보하기 위해 전문 성우 5명(여성 3명, 남성 2명)을 선정하였다.
- 모델 학습 및 평가를 위해 Tacotron 2 아키텍처를 기반으로 신경망 TTS 시스템을 구축하였다.
- 주관적 평가를 위해 커뮤니티 기반의 평균의견점수(MOS)를 활용하여 합성 음성의 자연스러움과 품질을 평가하였다.
- 합성 출력에 대한 세부적인 오류 분석을 수행하여 잘못된 발음, 단어 생략 등의 일반적인 실패 유형을 파악하였다.
- 학술 및 산업용으로 사용 가능하도록 전체 코퍼스, 학습 코드, 미리 학습된 모델을 공개 GitHub 리포지터리에 배포하였다.
실험 결과
연구 질문
- RQ1확장되고 다양화된 TTS 코퍼스가 카자흐어 음성합성의 품질과 내재성 향상에 기여할 수 있는가?
- RQ2성우 다양성과 데이터 양을 증가시키는 것이 카자흐어 합성 음성의 자연스러움과 이해도에 얼마나 기여하는가?
- RQ3다양한 텍스트 출처(뉴스, 책, 위키백과)가 TTS 모델의 성능과 일반화 능력에 어떤 영향을 미치는가?
- RQ4합성 음성에서 주로 발생하는 오류 유형은 무엇이며, 향후 모델에서 이를 어떻게 완화할 수 있는가?
- RQ5KazakhTTS2 코퍼스가 다른 투르크어계 언어에서의 전이학습 및 다국어 응용의 기초 자료로 활용될 수 있는가?
주요 결과
- KazakhTTS2 코퍼스는 다양한 출처에서 확보한 5명의 전문 성우(여성 3명, 남성 2명)로부터의 고품질 수작업 음성 텍스트 변환 데이터 총 271시간을 포함한다.
- 모든 5명의 성우가 주관적 평균의견점수(MOS) 3.6에서 4.2 사이를 기록하여 실제 응용에 적합한 고품질 음성 품질을 확보하였다.
- 성우 M2가 가장 높은 MOS(4.2)를 기록하였고, 이전 버전에서 가장 높은 점수를 기록한 F1과 M1 뉴스는 각각 4.726와 4.360의 점수를 기록하였다.
- 합성 음성에서 가장 흔한 오류 유형은 잘못된 발음(15건), 완전하지 않은 단어(14건), 단어 생략(14건)이었으며, M1에서 가장 높은 오류 수를 기록하였다.
- Tacotron 2를 사용한 상태의 최신 TTS 모델을 학습시킬 수 있으며, 다양한 평가 지표와 신뢰구간에서 일관된 결과를 도출하였다.
- 코퍼스, 코드, 미리 학습된 모델은 GitHub에 공개되어 있어 재현성과 향후 카자흐어 및 관련 저자원 언어 연구를 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.