Skip to main content
QUICK REVIEW

[論文レビュー] Daft-Exprt: Robust Prosody Transfer Across Speakers for Expressive Speech Synthesis.

Julian Zaïdi, Hugo Seuté|arXiv (Cornell University)|Aug 4, 2021
Speech Recognition and Synthesis参考文献 29被引用数 5
ひとこと要約

Daft-Exprt は、FiLM条件付けと adversarial 学習を用いて発話者間の抑揚転送を向上させるマルチスプリーカー音声モデルであり、抑揚と発話者アイデンティティを分離する。自然な音声品質を維持しながら、発話者間およびテキスト間の抑揚転送で最先端の性能を達成し、公開されたコードとサンプルを提供する。

ABSTRACT

This paper presents Daft-Exprt, a multi-speaker acoustic model advancing the state-of-the-art on inter-speaker and inter-text prosody transfer. This improvement is achieved using FiLM conditioning layers, alongside adversarial training that encourages disentanglement between prosodic information and speaker identity. The acoustic model inherits attractive qualities from FastSpeech 2, such as fast inference and local prosody attributes prediction for finer grained control over generation. Experimental results show that Daft-Exprt significantly outperforms strong baselines on prosody transfer tasks, while yielding naturalness comparable to state-of-the-art expressive models. Moreover, results indicate that adversarial training effectively discards speaker identity information from the prosody representation, which ensures Daft-Exprt will consistently generate speech with the desired voice. We publicly release our code and provide speech samples from our experiments.

研究の動機と目的

  • 発話者間の表現音声合成における抑揚転送を向上させるとともに、発話者アイデンティティを維持すること。
  • adversarial 学習を用いて、抑揚情報を発話者アイデンティティから分離すること。
  • FastSpeech 2 にインspired された、高速推論と局所的抑揚予測を実現すること。
  • 最先端の表現音声モデルと同等の自然さを達成すること。
  • 抑揚表現から発話者アイデンティティを除去することで、一貫した音声生成を実現すること。

提案手法

  • 抑揚条件付けベクトルに基づいて音声モデルを調整するための FiLM 条件付け層を用いる。
  • 生成された抑揚表現から発話者アイデンティティを排除するよう促すために adversarial 学習を採用する。
  • 高速推論と局所的抑揚予測を実現するため、FastSpeech 2 のアーキテクチャを適応する。
  • 本物の抑揚表現と生成された抑揚表現を区別するためのディスクラミネーターを訓練する。これにより、分離が促進される。
  • 共有音声モデルと発話者固有の条件付けを組み合わせたマルチスプリーカー設定を採用する。
  • 再構成損失、adversarial 損失、および発話時間予測損失を含むエンドツーエンドの訓練を統合する。

実験結果

リサーチクエスチョン

  • RQ1FiLM 条件付けは、表現音声合成における異なる発話者間の抑揚転送を向上させることができるか?
  • RQ2adversarial 学習は、潜在表現における抑揚コンテンツと発話者アイデンティティを効果的に分離できるか?
  • RQ3優れた抑揚転送性能を達成しながらも、自然な音声品質を維持できるか?
  • RQ4抑揚を転送した音声を生成する際、発話者アイデンティティはどの程度保持されるか?
  • RQ5発話者間およびテキスト間の抑揚転送タスクにおいて、強力なベースラインと比較してどのように性能を発揮するか?

主な発見

  • Daft-Exprt は、発話者間およびテキスト間の抑揚転送タスクにおいて、強力なベースラインを顕著に上回る性能を達成した。
  • adversarial 学習により、抑揚表現から発話者アイデンティティが効果的に排除され、一貫した音声生成が実現した。
  • 最先端の表現音声合成モデルと同等の自然さを達成した。
  • FiLM 条件付けにより、音声生成中に抑揚属性を細かく制御できるようになった。
  • FastSpeech 2 にインspired されたアーキテクチャのおかげで、高速な推論速度を維持した。
  • コードと音声サンプルの公開により、再現性とさらなる研究が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。