[論文レビュー] Limited Data Emotional Voice Conversion Leveraging Text-to-Speech: Two-stage Sequence-to-Sequence Training
本稿では、データ不足を補うためにテキストtoスピーチ(TTS)の事前学習を活用する二段階のシーケンスtoシーケンス(seq2seq)フレームワークを提案する。まずマルチスプーカーTTSを用いてスタイルの分離を初期化し、その後限られた感情音声データで微調整することで、スペクトル的およびプロソディックな変換において最先端の性能を達成し、最小限のラベル付きデータで、客観的および主観的評価においてベースラインを著しく上回る。
Emotional voice conversion (EVC) aims to change the emotional state of an utterance while preserving the linguistic content and speaker identity. In this paper, we propose a novel 2-stage training strategy for sequence-to-sequence emotional voice conversion with a limited amount of emotional speech data. We note that the proposed EVC framework leverages text-to-speech (TTS) as they share a common goal that is to generate high-quality expressive voice. In stage 1, we perform style initialization with a multi-speaker TTS corpus, to disentangle speaking style and linguistic content. In stage 2, we perform emotion training with a limited amount of emotional speech data, to learn how to disentangle emotional style and linguistic information from the speech. The proposed framework can perform both spectrum and prosody conversion and achieves significant improvement over the state-of-the-art baselines in both objective and subjective evaluation.
研究の動機と目的
- 限られた感情音声データでの高品質な感情音声変換(EVC)システムの訓練に直面する課題に対処すること。
- TTSとEVCの両者に共通する表現的なスピーチ生成の目的を活用し、モデルの汎化性および分離性を向上させること。
- 平行データを必要とせず、多対多の感情音声変換を可能にすること。
- アテンション機構を用いてフレーム単位からシーケンスレベルのアライメントに移行させることで、プロソディーおよび継続時間のモデリングを改善すること。
- 限られた感情音声データのみを用いて、WaveRNN音声生成器を感情に特化して微調整することで、音声品質を向上させること。
提案手法
- 段階1:マルチスプーカーTTSコーパスを用いて、言語的コンテンツと発話スタイルを分離するスタイルの初期化を行う。
- 段階2:限られた感情音声データで、モデル全体を微調整し、感情固有のスタイル分離を学習する。
- 言語的空間における感情関連情報を抑圧するために、感情エンコーダーと分類器を統合する。
- アテンションベースのseq2seqアーキテクチャを用い、音声的および言語的埋め込み間のアライメントをモデル化することで、階層的プロソディーモデリングを実現する。
- 限られた感情音声データのみを用いて、WaveRNN音声生成器を感情に特化して微調整し、知覚的品質を向上させる。
- シーケンスレベルの監督を用いて、スペクトル的および継続時間の変換を統合的に最適化するエンドツーエンドの訓練を行う。

実験結果
リサーチクエスチョン
- RQ1二段階の訓練戦略は、seq2seq感情音声変換におけるデータ依存性を低減できるか?
- RQ2TTS事前学習は、低データ環境下でも言語的コンテンツと感情的・話者スタイルを効果的に分離できるか?
- RQ3シーケンスレベルのアテンションモデリングは、フレーム単位の手法と比較してプロソディーおよび継続時間の変換を改善できるか?
- RQ4WaveRNN音声生成器の感情に特化した微調整は、最小限のデータで知覚的品質を向上させられるか?
- RQ5提案フレームワークは、客観的指標および主観的聴取テストにおいて、最先端のベースラインと比較してどうなるか?
主な発見
- 提案されたSeq2seq-EVC-WA1およびSeq2seq-EVC-WA2モデルは、すべての感情ペアにおいて最小のMCD値を達成し、CycleGAN-EVCおよびStarGAN-EVCを上回った。
- WaveRNNを微調整したモデル(Seq2seq-EVC-WA2)は、最良のDDUR結果を達成し、継続時間変換能力が優れていることを示した。
- 主観的聴取テストでは、Seq2seq-EVC-WA2は、Neu-Sadの感情ペアにおいて90%の被験者から最高の音声品質と評価された。
- 感情類似度スコアは、Seq2seq-EVC-WA2がベースラインを著しく上回っており、特にNeu-Surペアにおいて、-2から+2のスケールで平均+1.8のスコアを記録した。
- アテンション機構により、可変的な発音継続時間のマッピングが可能であることが、アライメント可視化から明らかになった。同じ発話文が、ハッピーとサッドのターゲットで異なる継続時間を示した。
- 感情に特化したWaveRNN音声生成器の微調整により、BWS結果から確認されたように、一貫した音声品質の向上が得られた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。