Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning for Emotional Text-to-Speech Synthesis with Improved Emotion Discriminability

Rui Liu, Berrak Şişman|arXiv (Cornell University)|Apr 3, 2021
Speech Recognition and Synthesis参考文献 30被引用数 5
ひとこと要約

本稿では、音声感情認識(SER)モデルとの相互作用を通じて音声出力を段階的に最適化することで、感情を含むテキスト音声合成(TTS)を向上させる強化学習ベースのフレームワーク、i-ETTSを提案する。SERの正確性に基づく報酬関数を用いた方策勾配学習により、i-ETTSは82.8%の感情分類正確度を達成し、最先端のベースラインを著しく上回り、感情の識別性と表現性に優れていることが示された。

ABSTRACT

Emotional text-to-speech synthesis (ETTS) has seen much progress in recent years. However, the generated voice is often not perceptually identifiable by its intended emotion category. To address this problem, we propose a new interactive training paradigm for ETTS, denoted as i-ETTS, which seeks to directly improve the emotion discriminability by interacting with a speech emotion recognition (SER) model. Moreover, we formulate an iterative training strategy with reinforcement learning to ensure the quality of i-ETTS optimization. Experimental results demonstrate that the proposed i-ETTS outperforms the state-of-the-art baselines by rendering speech with more accurate emotion style. To our best knowledge, this is the first study of reinforcement learning in emotional text-to-speech synthesis.

研究の動機と目的

  • 感情の混同問題に対処すること。すなわち、合成音声が意図した感情を明確に伝えられない問題。
  • 大規模なラベル付き感情データに依存するのを減らすために、インタラクティブな強化学習を活用すること。
  • トレーニング中にSERモデルのパフォーマンスを直接最適化することで、感情の識別性を向上させること。
  • 音声品質と感情表現力の両方を向上させる安定した反復的トレーニング戦略の開発。

提案手法

  • i-ETTSフレームワークは、方策勾配に基づく強化学習アルゴリズムを用いてTTSモデルを最適化する。
  • 音声感情認識(SER)モデルが環境として機能し、合成音声に対する感情分類正確度というリアルタイムフィードバックを提供する。
  • 報酬関数は、合成音声におけるSERモデルの正確度と直接相関するように設計されており、TTSモデルがより識別可能な感情出力を生成するよう促進する。
  • 反復的トレーニング戦略が用いられ、まず最大尤度推定(MLE)によるTTSモデルの事前学習を行い、その後強化学習によるファインチューニングを行う。
  • グローバルスタイルトークン(GST)モジュールが、5つの感情カテゴリに対応する5つのスタイルトークンを用いて256次元の感情埋め込みを生成する。
  • 波形生成にはGriffin-Limが使用され、性能評価には目的指標(SER正確度)と主観指標(MOS、A/B好みテスト)の両方が用いられる。

実験結果

リサーチクエスチョン

  • RQ1強化学習は、感情を含むテキスト音声合成における感情の識別性を向上させ得るか?
  • RQ2事前学習済みSERモデルを用いたインタラクティブなトレーニングパラダイムは、合成音声の知覚的品質と感情の明瞭性にどのように影響するか?
  • RQ3SERに基づく報酬を用いた方策勾配最適化により、ETTSにおける大規模なラベル付き感情データの必要性を低減できるか?
  • RQ4反復的トレーニング戦略は、感情に配慮したTTSにおける学習の安定性を高め、収束を改善するか?
  • RQ5i-ETTSは、感情表現に関する客観的および主観的評価において、SOTAベースラインと比較してどのように差をつけるか?

主な発見

  • i-ETTSモデルは、合成音声における平均SER正確度が82.8%に達し、MTL-ETTS(73.8%)およびCET-ETTS(78.2%)を著しく上回った。
  • 主観的平均評価点(MOS)評価では、i-ETTSは全5つの感情カテゴリにおいて、両方のベースラインよりも高いスコアを獲得した。
  • A/B好みテストの結果、全感情カテゴリにおいて、聴取者らがi-ETTSが生成した音声を感情表現の面で一貫して好んだ。
  • 本手法により、SERパフォーマンスを直接最適化することで、感情の混同が低減され、学習されたスタイル埋め込みの解釈可能性と識別性が向上した。
  • 事前学習と強化学習によるファインチューニングを組み合わせた反復的トレーニング戦略により、学習の安定性が保たれ、一貫した性能向上が達成された。
  • 知る限り、本研究は強化学習を感情を含むテキスト音声合成に応用した初の試みであり、感情に配慮したTTSのための新たなパラダイムを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。