Skip to main content
QUICK REVIEW

[論文レビュー] KazakhTTS2: Extending the Open-Source Kazakh TTS Corpus With More Data, Speakers, and Topics

Saida Mussakhojayeva, Yerbolat Khassanov|arXiv (Cornell University)|Jan 15, 2022
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本稿では、カザフ語のオープンソース音声対応テキスト音声合成(TTS)コーパスを拡張した KazakhTTS2 を提案する。カザフ語は低リソースで屈曲語であるトルコ語族言語であり、本稿では5名の話者(女性3名、男性2名)が参加し、ニュース、書籍、ウィキペディアなど多様な出典から構成される、93時間から271時間に増加した音声データを含む。このコーパスにより、高品質なニューラルTTSモデルの学習が可能となり、主観的平均評価点(MOS)が3.6から4.2の間で達成された。これは、実用的応用に適していることを示しており、低リソースのトルコ語族言語研究を前進させるものである。

ABSTRACT

We present an expanded version of our previously released Kazakh text-to-speech (KazakhTTS) synthesis corpus. In the new KazakhTTS2 corpus, the overall size has increased from 93 hours to 271 hours, the number of speakers has risen from two to five (three females and two males), and the topic coverage has been diversified with the help of new sources, including a book and Wikipedia articles. This corpus is necessary for building high-quality TTS systems for Kazakh, a Central Asian agglutinative language from the Turkic family, which presents several linguistic challenges. We describe the corpus construction process and provide the details of the training and evaluation procedures for the TTS system. Our experimental results indicate that the constructed corpus is sufficient to build robust TTS models for real-world applications, with a subjective mean opinion score ranging from 3.6 to 4.2 for all the five speakers. We believe that our corpus will facilitate speech and language research for Kazakh and other Turkic languages, which are widely considered to be low-resource due to the limited availability of free linguistic data. The constructed corpus, code, and pretrained models are publicly available in our GitHub repository.

研究の動機と目的

  • カザフ語、すなわち低リソースで屈曲語であるトルコ語族言語における、大規模かつ高品質でオープンソースの音声コーパスの不足を解消すること。
  • データ量の増加、話者多様性の向上、トピックカバレッジの拡大によって、元の KazakhTTS コーパスを強化すること。
  • 主観的評価を通じて、コーパスが耐障害性があり実用的なTTSシステムの学習に有効であることを検証すること。
  • データ、コード、事前学習済みモデルの公開を通じて、カザフ語および他の低リソースのトルコ語族言語分野における今後の研究を支援すること。

提案手法

  • ニュース記事、出版済みの書籍、ウィキペディアのコンテンツなど多様な出典から、合計271時間の音声データを収集し、手動で音声認識を実施した。
  • 高品質な音声と言語的多様性を確保するため、5名のプロフェッショナル話者(女性3名、男性2名)を選定した。
  • モデルの学習と評価に、Tacotron 2アーキテクチャを用いたニューラルTTSシステムを構築した。
  • 合成音声の自然さと品質を評価するために、クラウドソーシングを活用した主観的評価(平均評価点:MOS)を実施した。
  • 合成出力の詳細なエラー分析を実施し、誤発音や語の省略といった一般的な失敗モードを同定した。
  • 研究および商業利用を目的として、GitHubリポジトリを通じて、完全なコーパス、トレーニングコード、事前学習済みモデルを公開した。

実験結果

リサーチクエスチョン

  • RQ1大幅に拡張され多様化したTTSコーパスは、カザフ語の音声合成の品質と耐障害性を向上させることができるか?
  • RQ2話者多様性とデータ量の増加が、カザフ語の合成音声の自然さと聞き取りやすさにどの程度寄与するか?
  • RQ3ニュース、書籍、ウィキペディアといった異なるテキスト出典は、TTSモデルの性能と一般化能力にどのような影響を与えるか?
  • RQ4合成音声における主なエラー種別は何か。今後のモデルでこれらのエラーをどのように軽減できるか?
  • RQ5KazakhTTS2コーパスは、他のトルコ語族言語におけるトランスファー学習やクロスリンガル応用の基盤として機能できるか?

主な発見

  • KazakhTTS2コーパスは、5名のプロフェッショナル話者(女性3名、男性2名)が参加し、ニュース、書籍、ウィキペディアなど多様な出典から構成される、271時間の高品質で手動で音声認識済みの音声データを含む。
  • 全5名の話者が、3.6から4.2の間で主観的平均評価点(MOS)を達成し、実用的応用に適した高品質な音声を示した。
  • 話者M2が最高のMOS(4.2)を記録した。一方、前回リリースではF1とM1 Newsが最高点(それぞれ4.726および4.360)を記録していた。
  • 合成音声で最も頻出するエラー種別は、誤発音(15件)、不完全な語(14件)、語の省略(14件)であり、M1が最も高いエラー数を示した。
  • コーパスを用いることで、Tacotron 2を用いた最先端のTTSモデルの学習が可能となり、複数の評価指標および信頼区間において一貫した結果が得られた。
  • コーパス、コード、事前学習済みモデルはすべてGitHubで公開されており、再現性およびカザフ語および関連する低リソース言語分野における今後の研究を支援している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。