Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Lingual Text-to-Speech Using Multi-Task Learning and Speaker Classifier Joint Training

Yang, J., Lei He|arXiv (Cornell University)|Jan 20, 2022
Speech Recognition and Synthesis被引用数 6
ひとこと要約

本論文は、多言語TTSシステムにおける多言語間話者類似度の向上を目的として、マルチタスク学習(MTL)と話者分類器の共同学習フレームワークを提案する。多言語トランスフォーマーTTSモデルとx-vector話者分類器を共同で学習し、近似平行スケジューリング手法を用いることで、複数の言語において、既知および未知の話者に対して顕著に高い話者類似度を達成した。客観的および主観的評価により、一貫した向上が確認された。

ABSTRACT

In cross-lingual speech synthesis, the speech in various languages can be synthesized for a monoglot speaker. Normally, only the data of monoglot speakers are available for model training, thus the speaker similarity is relatively low between the synthesized cross-lingual speech and the native language recordings. Based on the multilingual transformer text-to-speech model, this paper studies a multi-task learning framework to improve the cross-lingual speaker similarity. To further improve the speaker similarity, joint training with a speaker classifier is proposed. Here, a scheme similar to parallel scheduled sampling is proposed to train the transformer model efficiently to avoid breaking the parallel training mechanism when introducing joint training. By using multi-task learning and speaker classifier joint training, in subjective and objective evaluations, the cross-lingual speaker similarity can be consistently improved for both the seen and unseen speakers in the training set.

研究の動機と目的

  • 単一言語話者データしか利用できない状況下で、多言語間TTS合成における話者類似度の低さという課題に対処すること。
  • 合成された多言語話者の音声とネイティブ録音との間の話者類似度を向上させること、特に未知の話者に対して有効であること。
  • 多言語話者データや話者エンコーダーに基づくシステムを必要としない、話者表現を強化する学習フレームワークの開発。
  • 限られたデータで新しい未知の話者に対して効果的なモデルファインチューニングを可能にするとともに、高い話者類似度を維持すること。

提案手法

  • 多言語トランスフォーマーTTSモデルに話者および言語アイデンティティ分類器を追加するマルチタスク学習(MTL)フレームワークを導入し、適切な埋め込み学習を促進するため、交差エントロピー損失を用いる。
  • 同じ話者に対するオリジナル録音と合成多言語音声のx-vector間の距離を最小化するように、TTSモデルとx-vector話者分類器を共同で学習する。
  • 共同学習中に推論モードでの生成が必要なにもかかわらず、並列学習効率を維持するため、近似平行スケジューリング手法を採用する。
  • トランスフォーマーTTSフレームワーク内に固定次元の話者埋め込みと言語埋め込みを用いて、話者および言語特性をモデル化する。
  • 新規の低リソース話者に対してファインチューニングする際の過学習を防ぐために、言語バランス学習を適用する。
  • x-vectorシステムを微分可能な目的関数として活用し、TTSモデルが複数言語にわたって話者のアイデンティティと一致する音声を生成するように誘導する。

実験結果

リサーチクエスチョン

  • RQ1多言語話者データや話者エンコーダーを必要としない条件下で、マルチタスク学習が多言語TTSにおける話者類似度の向上に寄与するか。
  • RQ2x-vector話者分類器を用いた共同学習は、既知および未知の話者に対して多言語間話者類似度をどの程度向上させるか。
  • RQ3推論モードでの生成を伴う共同最適化を実現しつつ、学習効率を維持できるか。
  • RQ4さまざまな訓練データサイズを持つ複数の言語において、この手法が話者類似度をどの程度向上させるか。
  • RQ5限られたデータで新しい未知の話者に対して一般化可能であり、高い話者類似度を維持できるか。

主な発見

  • 既知の話者に対する多言語合成において、+MTL+Jointモデルは平均でコサイン距離を34%低減し、特にリソースが少ない言語で最も顕著な改善が観察された。
  • 約9分のデータを持つ新しいzh-CN話者に対して、類似度MOSはベースラインの3.99 ± 0.09から4.21 ± 0.07に上昇し、顕著な主観的改善が確認された。
  • 客観的評価では、新しいzh-CN話者のコサイン距離が言語をまたいで0.096から0.092に低下し、一貫した向上が得られた。
  • 約5分のデータを持つ新しいen-GB話者に対しては、ターゲット言語でのコサイン距離が0.088から0.083に低下し、多言語間設定では0.224から0.164に低下した。
  • x-vectorのコサイン距離と主観的類似度MOSの間に強い相関が確認され、x-vectorが話者類似度の客観的指標として有効であることが裏付けられた。
  • 本手法は、イントラリンガルな話者類似度よりも多言語間の話者類似度向上に顕著な効果を示し、多言語間損失目的関数の有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。