Skip to main content
QUICK REVIEW

[論文レビュー] Cross-lingual Multispeaker Text-to-Speech under Limited-Data Scenario

Zexin Cai, Yaogen Yang|arXiv (Cornell University)|May 21, 2020
Speech Recognition and Synthesis参考文献 18被引用数 5
ひとこと要約

本論文は、タコトロン2に基づく多言語・マルチスプーカー音声合成システムを提案する。このシステムは、共有された発音表記と別個の言語トークン、スプーカー埋め込みを用い、英語と中国語の両方で高精細でなめらかで聞き取りやすい音声合成を可能にする。主な貢献は、二か国語のデータセットで学習した場合に限られたデータ条件でも強力な多言語音声合成を実現し、話者の個性を保持したまま外国語の発音を自然に再現できることである。

ABSTRACT

Modeling voices for multiple speakers and multiple languages in one text-to-speech system has been a challenge for a long time. This paper presents an extension on Tacotron2 to achieve bilingual multispeaker speech synthesis when there are limited data for each language. We achieve cross-lingual synthesis, including code-switching cases, between English and Mandarin for monolingual speakers. The two languages share the same phonemic representations for input, while the language attribute and the speaker identity are independently controlled by language tokens and speaker embeddings, respectively. In addition, we investigate the model's performance on the cross-lingual synthesis, with and without a bilingual dataset during training. With the bilingual dataset, not only can the model generate high-fidelity speech for all speakers concerning the language they speak, but also can generate accented, yet fluent and intelligible speech for monolingual speakers regarding non-native language. For example, the Mandarin speaker can speak English fluently. Furthermore, the model trained with bilingual dataset is robust for code-switching text-to-speech, as shown in our results and provided samples.{https://caizexin.github.io/mlms-syn-samples/index.html}.

研究の動機と目的

  • 英語と中国語において、限られたデータ条件下で高精細でマルチスプーカーの多言語音声合成を可能にすること。
  • 低リソース環境下で、二か国語話者が持つ言語固有の知識が、単一言語話者にどのように転送可能かを調査すること。
  • 単一言語話者の声を用いて、自然で聞き取りやすく、なめらかなコードスイッチング音声を生成すること。
  • 非ネイティブ言語の発音を自然に保ちつつ、話者の個性を忠実に再現した音声を生成すること。

提案手法

  • モデルはタコトロン2を拡張し、言語トークンとスプーカー埋め込みを別々に条件付けすることで、言語と話者の個性を独立して制御する。
  • 英語と中国語の両方の入力に共通の発音表記を用いることで、異なる表記体系にもかかわらず多言語間の整合性を実現する。
  • 二か国語の学習データセット(DB-4)を導入し、学習中に二か国語話者から単一言語話者へ知識を転送可能にする。
  • 共通のテキストエンコーダーを用い、言語固有の条件付けにより両言語の正確なスペクトログラムを生成する。
  • 各モデルバージョンの合成スペクトログラム上でWaveRNN音声生成器をファインチューニングし、音声品質を向上させる。
  • 特にコードスイッチング状況を想定し、言語切り替え時の滑らかさを評価するため、注目メカニズムのアライメントを分析する。

実験結果

リサーチクエスチョン

  • RQ1限られた言語ごとのデータで、1つのTTSモデルが複数のスプーカーに対して高精細な音声を生成できるか?
  • RQ2二か国語データセットを組み込むことで、単一言語話者に対する多言語音声合成性能が向上するか?
  • RQ3単一言語話者が自らの声の埋め込みのみを用いて、自然で聞き取りやすく、なめらかな非ネイティブ言語の発音を生成できるか?
  • RQ4モデルの注目メカニズムは、英語と中国語の間でコードスイッチングを行う際、どのように振る舞うか?
  • RQ5低リソース環境下で、二か国語話者が持つ言語関連の知識が、単一言語話者にどの程度転送可能か?

主な発見

  • 二か国語データセット(DB-4)で学習したCLMSモデルは、中国語で自然さMOS 4.11、英語で3.97、コードスイッチングで3.99を達成し、あらゆる言語タイプで高品質な合成を示した。
  • 多言語音声合成において、CLMSモデルは英語で話者類似度MOS 4.17、コードスイッチングで4.22を記録し、話者の個性の強力な保持を示した。
  • 多言語音声の聞き取りやすさMOSは、CLMSモデルで英語で4.47、コードスイッチングで4.59に達し、明瞭で理解可能な外国語発音を実現した。
  • 二か国語データなしのBLMSモデルでは、英語の聞き取りやすさMOSが1.25にとどまり、多言語間転送に二か国語データが不可欠であることを確認した。
  • CLMSモデルの注目アライメントは、言語切り替え時に滑らかに推移しており、BLMSモデルとは異なり明確な途切れが見られなかった。これは、より優れた多言語モデリングを示している。
  • モデルは、中国語話者が英語を話す際、ネイティブに近い発音で自然で聞き取りやすく、なめらかな音声を生成することに成功した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。