Skip to main content
QUICK REVIEW

[論文レビュー] Transforming Spectrum and Prosody for Emotional Voice Conversion with Non-Parallel Training Data

Kun Zhou, Berrak Şişman|arXiv (Cornell University)|Feb 1, 2020
Speech and Audio Processing参考文献 63被引用数 17
ひとこと要約

本稿では、スペクトルおよびプロソディック変換にCycleGANを用いた非並列な感情音声変換フレームワークを提案する。F0は複数の時間スケールで連続ウェーブレット変換(CWT)によってモデル化される。この手法は、ベースラインと比較して優れた感情類似性を達成する。特に、スペクトルとプロソディックの分離学習により、93.6%および96.5%のXABテストでの好まれる割合を示し、共同学習を上回る性能を発揮する。

ABSTRACT

Emotional voice conversion aims to convert the spectrum and prosody to change the emotional patterns of speech, while preserving the speaker identity and linguistic content. Many studies require parallel speech data between different emotional patterns, which is not practical in real life. Moreover, they often model the conversion of fundamental frequency (F0) with a simple linear transform. As F0 is a key aspect of intonation that is hierarchical in nature, we believe that it is more adequate to model F0 in different temporal scales by using wavelet transform. We propose a CycleGAN network to find an optimal pseudo pair from non-parallel training data by learning forward and inverse mappings simultaneously using adversarial and cycle-consistency losses. We also study the use of continuous wavelet transform (CWT) to decompose F0 into ten temporal scales, that describes speech prosody at different time resolution, for effective F0 conversion. Experimental results show that our proposed framework outperforms the baselines both in objective and subjective evaluations.

研究の動機と目的

  • 音声変換のための並列な感情音声データの収集が現実的でないという問題に対処すること。
  • 単一スケールのF0表現を超えたプロソディックのモデリングにより、感情音声変換を向上させること。
  • スペクトルとプロソディックの分離学習と共同学習のどちらが感情類似性において優れているかを調査すること。
  • 連続ウェーブレット変換(CWT)を用いてF0を階層的な時間スケールに分解することで、F0変換を改善すること。
  • 敵対的損失およびサイクル整合性損失を用いた、並列データを必要としない高品質な感情音声変換システムの開発

提案手法

  • 非並列データを用いて、敵対的損失およびサイクル整合性損失を用いて、ソースとターゲットの感情音声間の双方向マッピングを学習するため、CycleGANを活用する。
  • 基本周波数(F0)を10の時間スケールに分解するために、連続ウェーブレット変換(CWT)を適用し、マルチスケールのプロソディックモデリングを実現する。
  • スペクトル変換とF0変換(CWT係数を介して)のためのCycleGANを別々に学習することで、限られたデータでも一般化性能を向上させる。
  • XAB聴取テストを用いて、変換された音声と参照ターゲットの間の感情類似性を評価する。
  • 同じ発話者による異なる感情の非並列発話文を訓練データとして用い、ペairedなソース・ターゲット例の必要性を回避する。
  • F0変換をスペクトル特徴から分離することで、プロソディックをコンテンツに依存しないものとしてモデル化し、未知の言語的コンテンツに対しても耐性を高める。

実験結果

リサーチクエスチョン

  • RQ1並列学習データを必要としないCycleGANベースのフレームワークは、効果的な感情音声変換を達成できるか?
  • RQ2複数の時間スケールで連続ウェーブレット変換(CWT)を用いてF0をモデリングすることで、感情プロソディック変換が向上するか?
  • RQ3スペクトルとプロソディック変換の分離学習は、感情類似性の観点で共同学習を上回るか?
  • RQ4提案手法は、客観的および主観的評価の両方において、ベースラインモデルと比較して優れているか?
  • RQ5フレームワークは、発話者アイデンティティおよび言語的コンテンツを保持しながら、感情表現を変換できるか?

主な発見

  • 提案されたCycleGAN-Separateフレームワークは、客観的および主観的評価の両方でベースラインを上回り、ニュートラルから怒りへの変換においてXABテストで93.6%の好まれる割合を達成した。
  • CycleGAN-Separate手法は、ニュートラルから驚きへの変換においてXABテストで96.5%の好まれる割合を達成し、優れた感情類似性を示した。
  • スペクトルとプロソディックの分離学習は、共同学習を著しく上回り、データが限られた状況下でプロソディックを独立してモデリングすることがより効果的であることを示した。
  • CWTベースのF0分解により、マルチスケールのプロソディックモデリングが可能になり、単一スケールのF0表現よりも階層的なイントネーションパターンをより効果的に捉えることができた。
  • コンテンツに依存しないプロソディック学習のおかげで、未知の言語的コンテンツに対しても良好な一般化性能を示し、特にデータが少ない状況下で顕著であった。
  • 敵対的損失およびサイクル整合性損失の活用により、非並列データから効果的な疑似ペアの発見が可能になり、高精細な感情変換が実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。