Skip to main content
QUICK REVIEW

[論文レビュー] Many-to-Many Voice Transformer Network

Hirokazu Kameoka, Wen-Chin Huang|arXiv (Cornell University)|May 18, 2020
Speech Recognition and Synthesis参考文献 71被引用数 9
ひとこと要約

本稿では、共有潜在空間を用いて複数の話者間の同時変換を学習できる、多対多のボイストランスフォーマーネットワーク(VTN)を提案する。アイデンティティマッピング損失とマルチスプリーカー条件付けを導入することで、ベースライン手法と比較して優れた音声品質と話者類似度を達成し、特に主観的聴取テストにおいて優れた性能を示し、1対1のシナリオを超えた柔軟な変換を可能にする。

ABSTRACT

This paper proposes a voice conversion (VC) method based on a sequence-to-sequence (S2S) learning framework, which enables simultaneous conversion of the voice characteristics, pitch contour, and duration of input speech. We previously proposed an S2S-based VC method using a transformer network architecture called the voice transformer network (VTN). The original VTN was designed to learn only a mapping of speech feature sequences from one speaker to another. The main idea we propose is an extension of the original VTN that can simultaneously learn mappings among multiple speakers. This extension called the many-to-many VTN makes it able to fully use available training data collected from multiple speakers by capturing common latent features that can be shared across different speakers. It also allows us to introduce a training loss called the identity mapping loss to ensure that the input feature sequence will remain unchanged when the source and target speaker indices are the same. Using this particular loss for model training has been found to be extremely effective in improving the performance of the model at test time. We conducted speaker identity conversion experiments and found that our model obtained higher sound quality and speaker similarity than baseline methods. We also found that our model, with a slight modification to its architecture, could handle any-to-many conversion tasks reasonably well.

研究の動機と目的

  • 逐次的変換(S2S)学習を用いることで、ピッチのなだらかさや話者の持続時間といったサブセグメンタル特徴を効果的に扱えるように、既存の音声変換(VC)手法の限界を克服すること。
  • 元のボイストランスフォーマーネットワーク(VTN)を1対1から多対多話者変換へ拡張し、複数話者間の統合的モデリングを可能にすること。
  • 入力特徴を保持するアイデンティティマッピング損失を導入することで、モデルの汎化性能と性能を向上させること。
  • テキストの発音変換やASRを必要とせず、任意対多対やリアルタイム変換を含む柔軟なVCタスクを可能にすること。
  • 話者間の性別が同一または異なるペアにおいて、客観的指標と主観的聴取テストの両方でモデルの性能を評価すること。

提案手法

  • 話者埋め込みベクトルを条件として用いることで、元のVTNアーキテクチャを複数のソースおよびターゲット話者をサポートするように拡張する。
  • ソース話者とターゲット話者インデックスが同一の場合の偏差をペナルティとするアイデンティティマッピング損失を導入し、モデルが入力特徴を保持するよう促進する。
  • マルチヘッド自己注意を用いたトランスフォーマーに基づくエンコーダ・デコーダアーキテクチャを採用し、音声系列における長距離依存性をモデル化する。
  • 実験ではWORLD音声生成器を用いるが、今後の改善としてニューラルボコーダを用いたエンドツーエンド学習を提案する。
  • 話者間で共有される潜在空間を活用し、共通のプロソディックおよびスペクトル的特徴を捉えることで、データ効率性と汎化性能を向上させる。
  • 推論時に任意のターゲット話者埋め込みを許容するようにアーキテクチャを変更することで、任意対多対変換を実現する。

実験結果

リサーチクエスチョン

  • RQ1複数話者で学習したS2S音声変換モデルは、共通のプロソディックおよびスペクトル的表現を共同で学習し、変換品質を向上させることができるか?
  • RQ2ソース話者とターゲット話者が同一の場合に、アイデンティティマッピング損失が入力特徴の保持にどの程度有効であるか、また汎化性能の向上に寄与するか?
  • RQ3多対多VTNは、主観的評価において1対1やベースラインS2S-VCモデルと比較して、音声品質および話者類似度の点で優れているか?
  • RQ4話者認識埋め込みを用いて話者埋め込みを置き換えることで、未知話者への一般化(ゼロショットVC)が可能になるか?
  • RQ5多対多VTNは、テキストのアノテーションを必要とせず、任意対多対やリアルタイム変換といった柔軟な変換タスクを処理できるか?

主な発見

  • 多対多VTNは、多対多ConvS2S-VCを除き、すべての競合手法と比較して平均意見スコア(MOS)が顕著に高く、マン・ホイットニー検定によるp値が0.05未満であった。
  • 1対1VTNおよび他のS2Sベースラインと比較して、話者類似度において主観的聴取テストで統計的に有意な改善(p < 0.05)を示した。
  • 多対多ConvS2S-VCより客観的スコア(MCDおよびLFC)が低かったが、主観的品質は優れており、知覚的品質とモデル設計との強い相関関係を示した。
  • アイデンティティマッピング損失は、特に話者アイデンティティと自然さの保持において、テスト時の性能向上に顕著に効果的であった。
  • 話者認識埋め込みを組み合わせた場合、未知話者への一般化が強く示され、ゼロショット音声変換の実現可能性を示唆した。
  • アーキテクチャの拡張により、最小限の変更で任意対多対変換タスクにおいて妥当な性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。