Skip to main content
QUICK REVIEW

[論文レビュー] CycleTransGAN-EVC: A CycleGAN-based Emotional Voice Conversion Model with Transformer

Changzeng Fu, Chaoran Liu|arXiv (Cornell University)|Nov 30, 2021
Speech Recognition and Synthesis参考文献 22被引用数 8
ひとこと要約

本稿では、時間的モデリングと受容 field の向上を図るためにトランスフォーマーを統合した、CycleGANに基づく感情音声変換モデルであるCycleTransGAN-EVCを提案する。平行データを必要とせず、高品質で安定した感情音声変換を実現する。主観評価において、特にカリキュラム学習を用いることで、ACVAE や CycleGAN のベースラインを上回る感情の強さと自然さを達成する。

ABSTRACT

In this study, we explore the transformer's ability to capture intra-relations among frames by augmenting the receptive field of models. Concretely, we propose a CycleGAN-based model with the transformer and investigate its ability in the emotional voice conversion task. In the training procedure, we adopt curriculum learning to gradually increase the frame length so that the model can see from the short segment till the entire speech. The proposed method was evaluated on the Japanese emotional speech dataset and compared to several baselines (ACVAE, CycleGAN) with objective and subjective evaluations. The results show that our proposed model is able to convert emotion with higher strength and quality.

研究の動機と目的

  • 長距離の時間的依存関係を捉える能力に欠けるCNNベースのモデルの限界を解消し、感情音声変換における音声の安定性を維持すること。
  • トランスフォーマーが音声変換タスクにおいてフレーム内関係をモデリングし、受容 field を拡大する有効性を調査すること。
  • 非平行な感情音声変換にサイクル一貫性 adversarial ネットワークを活用することで、平行データへの依存度を低減すること。
  • カリキュラム学習と細分化された識別器を用いて、変換音声の感情の強さ、音声品質、自然さを向上させること。

提案手法

  • モデルは、ソースおよびターゲットの感情音声間のサイクル一貫性写像を学習するため、2つの生成器と2つの識別器を備えたCycleGANフレームワークを採用する。
  • 長距離の時間的依存関係をモデル化し、CNNが達成できる範囲を超えた受容 field を拡大するために、生成器にトランスフォーマーを統合する。
  • 入力特徴はF0(基本周波数)とスペクトログラムであり、F0には連続ウェーブレット変換(CWT)を、スペクトログラムにはCheapTrickを用いて抽出する。
  • カリキュラム学習戦略として、訓練エポックに伴い入力系列長を短いセグメントから全発話へ段階的に増加させることで、学習の安定性と感情特徴の捉え込みを向上させる。
  • 局所的な感情の一貫性を評価するため、細分化されたレベルの識別器を導入するが、全体の感情類似度にはわずかに悪影響を及ぼす。
  • 全体の損失は adversarial 損失、サイクル一貫性損失、アイデンティティ損失を組み合わせており、ハイパーパrameterは訓練中に最適化される。

実験結果

リサーチクエスチョン

  • RQ1CNNベースのモデルと比較して、トランスフォーマーは感情音声変換におけるフレーム内時間的依存関係のモデリングをどのように改善するか?
  • RQ2短い音声セグメントから始め、段階的に系列長を延長するカリキュラム学習は、感情特徴の学習能力を向上させるか?
  • RQ3細分化された識別器の統合は、非平行音声変換における感情の忠実度と音声の自然さにどのような影響を与えるか?
  • RQ4提案されたCycleTransGAN-EVCモデルは、既存のベースライン(ACVAE、CycleGAN)と比較して、感情の強さ、音声品質、自然さのどの程度優れているか?

主な発見

  • CycleTransGAN-Allモデルは、音声品質と自然さのMean Opinion Score(MOS)が最高を記録し、すべてのベースラインおよびアブレーション変種を上回った。
  • 感情類似度に関しては、細分化された識別器を搭載しないCycleTransGAN-CLが、怒りと悲しみの感情に対して最高のMOSを達成した。これは、細分化された識別器が顕著な感情特徴から注意力を逸らす可能性があることを示唆している。
  • ハッピーな感情に対しては、CycleTransGAN-Allが最高のMOSを記録し、高エネルギーな感情変換において優れた性能を示した。
  • カリキュラム学習の導入により、感情の特徴学習能力が顕著に向上した。特に、感情の特徴が集中している短いセグメントにおいて顕著であった。
  • 改善は見られたが、生成音声の明瞭さと感情の強さは依然としてさらなる向上が求められるため、今後の最適化の余地がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。