Skip to main content
QUICK REVIEW

[論文レビュー] Emotional Voice Conversion With Cycle-consistent Adversarial Network

Songxiang Liu, Yuewen Cao|arXiv (Cornell University)|Apr 8, 2020
Speech Recognition and Synthesis参考文献 29被引用数 9
ひとこと要約

本稿では、平行データと動的時間ワープ(DTW)の必要性を排除するため、サイクル整合性のある敵対的学習を用いた、感情音声変換(EVC)のためのCycleGANベースの手法を提案する。この手法は、本物の音声と生成された音声を区別する2つの識別器と、感情アイデンティティを保持するための分類器を採用し、アライメントエラーなしに、客観的および主観的評価において競争力ある結果を達成している。

ABSTRACT

Emotional Voice Conversion, or emotional VC, is a technique of converting speech from one emotion state into another one, keeping the basic linguistic information and speaker identity. Previous approaches for emotional VC need parallel data and use dynamic time warping (DTW) method to temporally align the source-target speech parameters. These approaches often define a minimum generation loss as the objective function, such as L1 or L2 loss, to learn model parameters. Recently, cycle-consistent generative adversarial networks (CycleGAN) have been used successfully for non-parallel VC. This paper investigates the efficacy of using CycleGAN for emotional VC tasks. Rather than attempting to learn a mapping between parallel training data using a frame-to-frame minimum generation loss, the CycleGAN uses two discriminators and one classifier to guide the learning process, where the discriminators aim to differentiate between the natural and converted speech and the classifier aims to classify the underlying emotion from the natural and converted speech. The training process of the CycleGAN models randomly pairs source-target speech parameters, without any temporal alignment operation. The objective and subjective evaluation results confirm the effectiveness of using CycleGAN models for emotional VC. The non-parallel training for a CycleGAN indicates its potential for non-parallel emotional VC.

研究の動機と目的

  • 平行データに依存する感情音声変換(EVC)手法の限界を是正すること。特に、アライメントに動的時間ワープ(DTW)に依存する点を改善する。
  • 最小生成損失(例:L1/L2)の代わりに生成的敵対的学習を用いることで、変換音声の過剰平滑化を低減し、自然さを向上させること。
  • 非平行EVCの可能性を検証し、非同期な感情音声データを用いた柔軟でスケーラブルな学習を可能にする、CycleGANの有効性を調査すること。
  • 客観的指標(MCD、LogF0-MSE)および感情移転の主観的評価を用いて、CycleGANベースのEVCの性能を評価すること。
  • 敵対的学習とサイクル整合性、感情分類を組み合わせることで、変換中に言語的コンテンツと感情アイデンティティを効果的に保持できることを検証すること。

提案手法

  • サイクル整合性を確保するため、出力感情から元の感情に変換する2つの生成器を備えたCycleGANフレームワークを採用する。
  • 本物/偽物の音声を分類する識別器と、変換音声が知覚的品質を保っていることを保証する識別器の2つの識別器を用いる。
  • 本物および変換された音声が感情によって正しく分類されるようにするため、別個の感情分類器を導入し、感情アイデンティティの保持を強化する。
  • フレームレベルのアライメントを必要とせず、敵対的損失、サイクル整合性損失、分類損失の組み合わせによりモデルを学習する。
  • スペクトル特徴とF0プロファイル(CWTまたは対数形式)を入力とし、モデルがプロソディックおよびスペクトル次元を統合的に学習する。
  • 学習中にソースとターゲット音声をランダムにペアリングすることで、並列スクリプトやDTWベースのアライメントの必要性を排除する。

実験結果

リサーチクエスチョン

  • RQ1非平行学習データやDTWアライメントを必要としないCycleGANベースの学習が、競争力ある感情音声変換性能を達成できるか?
  • RQ2敵対的損失を最小生成損失(例:L1/L2)と比較した場合、音声の自然さと知覚的品質にどのような差が生じるか?
  • RQ3客観的指標と主観的評価の両方で測定した場合、CycleGANが変換中に感情アイデンティティをどの程度保持できるか?
  • RQ4F0とエネルギーの両方の特徴学習を組み合わせることで、単純なF0正規化よりも変換品質が向上するか?
  • RQ5主観的評価において、異なる感情ペア(例:ニュートラル→悲しみ vs. ニュートラル→怒り)に対して、モデルの性能はどのように変化するか?

主な発見

  • 同じ特徴組み合わせを用いた場合、CycleGANベースのモデルは、最小生成損失を使用しないにもかかわらず、DBLSTMベースラインと比較してMCD(メルケプストラム歪み)が低かった。
  • ニュートラル→悲しみ変換において、CycleGAN-2(スペクトル特徴と対数F0を使用)は、悲しみの認識率が65.6%と最も高く、他のモデルを上回った。
  • ニュートラル→怒り変換においては、DBLSTM-1がMCDとLF0-MSEで最高を記録したが、CycleGAN-1はその94.2%の性能を達成し、著しく自然な音声品質を示した。
  • 主観的評価では、CycleGAN-2が悲しみ変換において最も高い正しく分類された感情認識率(65.6%)を示し、強い知覚的整合性を示した。
  • 非平行学習によるアライメントエラーなしに、CycleGANモデルは言語的コンテンツと発話者アイデンティティを効果的に保持しながら、感情を効果的に転送した。
  • 敵対的損失と感情分類器の組み合わせにより、フレームレベルの明示的アライメントがなくても、最小生成損失よりも自然な音声が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。