Skip to main content
QUICK REVIEW

[論文レビュー] Cross-speaker Emotion Transfer Based on Speaker Condition Layer Normalization and Semi-Supervised Training in Text-To-Speech

Pengfei Wu, Junjie Pan|arXiv (Cornell University)|Oct 8, 2021
Speech Recognition and Synthesis参考文献 19被引用数 11
ひとこと要約

本論文は、話者条件層正規化(SCLN)とグローバルスタイルトークン(GSTs)を用いた半教師あり学習を組み合わせた非自己回帰的音声合成モデルを提案する。これにより、感情の制御可能な跨話者移行が可能となる。感情トークンに交差エントロピー損失と半教師あり精練を適用することで、ベースラインと比較して高品質なトーン類似度と向上した安定性・感情認識が達成され、主観評価および安定性指標において先行研究を上回る結果を得た。

ABSTRACT

In expressive speech synthesis, there are high requirements for emotion interpretation. However, it is time-consuming to acquire emotional audio corpus for arbitrary speakers due to their deduction ability. In response to this problem, this paper proposes a cross-speaker emotion transfer method that can realize the transfer of emotions from source speaker to target speaker. A set of emotion tokens is firstly defined to represent various categories of emotions. They are trained to be highly correlated with corresponding emotions for controllable synthesis by cross-entropy loss and semi-supervised training strategy. Meanwhile, to eliminate the down-gradation to the timbre similarity from cross-speaker emotion transfer, speaker condition layer normalization is implemented to model speaker characteristics. Experimental results show that the proposed method outperforms the multi-reference based baseline in terms of timbre similarity, stability and emotion perceive evaluations.

研究の動機と目的

  • 任意の話者に対して限られた感情付き音声データを扱う課題に対処するため、感情付きコーパスを持つソース話者から、アノテーションなしのターゲット話者へ感情移行を可能にする。
  • 話者不一致に起因するトーン類似度の低下を防ぐために、跨話者感情移行において高いトーン類似度を維持すること。
  • 感情表現の解釈可能性と制御性を向上させるために、感情トークンの半教師あり学習を実施すること。
  • 話者条件層正規化(SCLN)を統合することで、話者と感情の因子を分離し、合成の安定性と自然さを向上させること。
  • 自己回帰的モデルと比較して、より優れた特徴分離と低減された特徴漏洩を実現する非自己回帰的TTSフレームワークの構築

提案手法

  • トランスフォーマーに基づくテキストエンコーダーと非自己回帰的スペクトログラムデコーダーを備えた並列Tacotronアーキテクチャを採用する。
  • 話者および感情に依存する入力を有するディレイド予測器を導入し、1次元畳み込み層とトランスフォーマーブロックを用いて音素の持続時間を予測する。
  • 各LConvおよびフィードフォワード層の後に話者条件層正規化(SCLN)を適用し、話者埋め込みが正規化パラメータ(スケールおよびバイアス)を条件付きで制御する。
  • リファレンスエンコーダーを用いてメルスペクトログ램埋め込みを抽出し、これを学習済みの感情トークンに対して照準として用い、重み付きの感情埋め込みを生成する。
  • 感情トークンに交差エントロピー損失を適用する半教師あり学習戦略を実装し、解釈可能で制御可能な感情表現の学習を可能にする。
  • 音声品質、持続時間の正確さ、感情制御の最適化を同時に達成するため、再構成損失、持続時間予測損失、感情分類器損失の組み合わせでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1グローバルスタイルトークンの半教師あり学習は、跨話者感情移行におけるより解釈可能で制御可能な感情表現を可能にするか?
  • RQ2話者条件層正規化(SCLN)は、跨話者感情移行においてトーン類似度を効果的に維持できるか?
  • RQ3提案手法の非自己回帰的モデルは、自己回帰的ベースラインと比較して、特徴分離と安定性に優れているか?
  • RQ4提案手法は、マルチリファレンスおよびベースラインモデルと比較して、感情認識と合成安定性をどの程度向上させるか?
  • RQ5多様な感情に一般化可能であり、話者アイデンティティと感情表現力を維持できるか?

主な発見

  • 提案手法は平均3.66のトーン類似度スコアを達成し、ベースライン(3.28)およびM1(3.51)を大きく上回り、M1と比較して全体的なトーン類似度で0.15の向上を示した。
  • ぼやけた音声安定性指標において、提案手法は誤差率を10.00%まで低下させ、ベースライン(25.67%)と比較して15.67%の絶対的改善を達成した。
  • 提案手法は合計18.33%の安定性誤差率を達成し、ベースライン(32.67%)と比較して14.34%の低減を示し、優れた合成信頼性を示した。
  • 感情認識評価において、提案手法は53.24%の好まれるスコアを獲得し、ベースライン(40.57%)を有意に上回り、p値 < 0.01の有意差を示した。これはユーザーの好まれる傾向が強いことを示している。
  • アブレーションスタディの結果、SCLNは特に悲しみや怒りといった困難な感情においてトーン類似度の向上に寄与しており、半教師あり学習は感情認識を損なわず安定性を向上させることを確認した。
  • SCLNを含まないM2(半教師あり戦略を採用)と比較して、安定性(18.33% vs. 27.30%の合計誤差率)で優れた性能を示したが、トーン類似度はわずかに低かった。これはSCLNが実世界への展開において極めて重要であることを裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。