Skip to main content
QUICK REVIEW

[論文レビュー] Creating New Language and Voice Components for the Updated MaryTTS Text-to-Speech Synthesis Platform

Ingmar Steiner, Sébastien Le Maguer|arXiv (Cornell University)|Dec 13, 2017
Speech Recognition and Synthesis参考文献 17被引用数 7
ひとこと要約

本論文は、Gradleビルド自動化およびクラウドホスティングインfra構造を活用することで、アップデートされたMaryTTSテキスト音声変換プラットフォームにおけるカスタム言語および合成音声コンポーネントの作成を簡素化した新しいワークフローを提示する。このアプローチにより、HMMベースおよびニューラルネットワークベースの音声合成をサポートする多言語TTSシステムの効率的でモジュラーな開発が可能となり、研究者や開発者の技術的負担が著しく軽減され、拡張性が向上する。

ABSTRACT

We present a new workflow to create components for the MaryTTS text-to-speech synthesis platform, which is popular with researchers and developers, extending it to support new languages and custom synthetic voices. This workflow replaces the previous toolkit with an efficient, flexible process that leverages modern build automation and cloud-hosted infrastructure. Moreover, it is compatible with the updated MaryTTS architecture, enabling new features and state-of-the-art paradigms such as synthesis based on deep neural networks (DNNs). Like MaryTTS itself, the new tools are free, open source software (FOSS), and promote the use of open data.

研究の動機と目的

  • レガシーマリーティーティーエス(MaryTTS)システムにおける増大する複雑さと技術的負債が、寄稿や拡張性を妨げていたのを是正する。
  • 古くなったツールキットに代わるスケーラブルで自動化されたワークフローを導入することで、新しい言語およびボイスコンポーネントの作成プロセスを近代化する。
  • 深層ニューラルネットワークベースの音声合成を含む最新のTTSパラダイムを、オープンソースのMaryTTSプラットフォームに統合する。
  • 依存関係管理、モジュラーなプロジェクト構造、コンポーネントのクラウドベース配布を可能にすることで、開発者体験を向上させる。
  • ユニットセレクションおよびパラメトリック(HMMベース)音声合成を、一貫性があり再利用可能なパイプラインで統合する。

提案手法

  • レガシーツールキットに代わる拡張性のあるプラグインベースのワークフローを可能にするために、中央集権的なビルド自動化ツールとしてGradleを採用する。
  • 語彙、言語、データ、ボイスプロジェクトを独立して管理・公開できる、モジュラーで依存関係駆動のワークフローを設計する。
  • アーティファクトおよびデータ配布のためのクラウドホスティングリポジトリ(Bintray、GitHub)を活用し、大容量の音声データセット用のリリースアセットを提供する。
  • 強制同期(forced alignment)用(kaldi-mfa-plugin)、特徴抽出用(nosep)、モデル学習用(hts-voicebuilding-plugin)、設定生成用の専用Gradleプラグインを統合する。
  • HMM-GMM/DNNおよびMerlinやWORLD、STRAIGHTといったフレームワークや音声合成器と互換性のあるパラメトリックモデルを含む、複数の音声合成パラダイムをサポートする。
  • 実行時動作をコンポーネントのビルド時設定から分離するための3段階構成システム(デフォルト、ボイス、ユーザー)を実装する。

実験結果

リサーチクエスチョン

  • RQ1MaryTTSにおける新しい言語およびボイスコンポーネントの作成プロセスを、どのようにしてスケーラブルで、保守可能で、研究者や開発者にとってアクセスしやすくできるか?
  • RQ2現代的なビルド自動化およびクラウドインfraストラクチャは、TTSコンポーネント開発における技術的負担をどのように軽減できるか?
  • RQ3ユニットセレクションとパラメトリック(HMMベース)音声合成の両方を、単一で拡張可能なワークフローで統合するにはどうすればよいか?
  • RQ4オープンソースのFOSSベースツールおよび依存関係管理は、TTSシステムの拡張および配布をどの程度簡素化できるか?
  • RQ5深層学習ベースのTTSモデルの統合を、モジュラーで拡張可能かつ後方互換性を保ったフレームワーク内でどのように実現できるか?

主な発見

  • 新しいGradleベースのワークフローにより、技術的負担を軽減しながら、効率的でモジュラーかつ再現性のある新しい言語およびボイスコンポーネントの作成が可能になった。
  • クラウドホスティングリポジトリ(Bintray、GitHub)の使用により、言語モデル、ボイスデータ、学習済みモデルのシームレスな配布および依存関係解決が可能になった。
  • 強制同期、特徴抽出、モデル学習のための専用Gradleプラグインの統合により、ボイス構築パイプライン全体が簡素化された。
  • 新しいシステムは、従来のHMMベース音声合成と最新のニューラルネットワークベースTTSを両方サポートしており、MerlinなどのフレームワークやWORLD、STRAIGHTなどの音声合成器との拡張性も備えている。
  • 3段階構成の設定システム(デフォルト、ボイス、ユーザー)により、コンポーネントのビルドを変更せずに柔軟な実行時カスタマイズが可能になった。
  • プロジェクト構造により、各言語およびボイスが個別のGitHubリポジトリを持つことが可能になり、保守性と貢献者へのアクセス性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。