Skip to main content
QUICK REVIEW

[論文レビュー] Investigation of Using Disentangled and Interpretable Representations for One-shot Cross-lingual Voice Conversion

Seyed Hamidreza Mohammadi, Tae-Hwan Kim|arXiv (Cornell University)|Aug 15, 2018
Speech Recognition and Synthesis参考文献 24被引用数 7
ひとこと要約

本稿では、1ショットのクロスリンガルボイスコンバージョンにおいて、因子化された階層的変分オートエンコーダー(FHVAE)を用いた分離可能で解釈可能な表現学習手法を提案する。これにより、1つのターゲットスピーカー発話のみで高品質なボイスコンバージョーンが可能となる。VAE-STFTおよびGMMベースラインと比較して、特にSTFTではなくWorld音声コーディング特徴を用いることで、優れた音声品質とスピーカー類似度を達成している。

ABSTRACT

We study the problem of cross-lingual voice conversion in non-parallel speech corpora and one-shot learning setting. Most prior work require either parallel speech corpora or enough amount of training data from a target speaker. However, we convert an arbitrary sentences of an arbitrary source speaker to target speaker's given only one target speaker training utterance. To achieve this, we formulate the problem as learning disentangled speaker-specific and context-specific representations and follow the idea of [1] which uses Factorized Hierarchical Variational Autoencoder (FHVAE). After training FHVAE on multi-speaker training data, given arbitrary source and target speakers' utterance, we estimate those latent representations and then reconstruct the desired utterance of converted voice to that of target speaker. We investigate the effectiveness of the approach by conducting voice conversion experiments with varying size of training utterances and it was able to achieve reasonable performance with even just one training utterance. We also examine the speech representation and show that World vocoder outperforms Short-time Fourier Transform (STFT) used in [1]. Finally, in the subjective tests, for one language and cross-lingual voice conversion, our approach achieved significantly better or comparable results compared to VAE-STFT and GMM baselines in speech quality and similarity.

研究の動機と目的

  • 非並列で1ショットの設定において、最小限のターゲットスピーカー音声データでのクロスリンガルボイスコンバージョンの課題に対処すること。
  • 音声の発話文脈とスピーカーIDを分離可能な解釈可能な潜在表現として学習することで、言語間で音声の発話文脈とスピーカー識別子を保存できるかを検証すること。
  • 特にWorld音声コーディング特徴とSTFTの比較を通じて、より良いボイスコンバージョン性能をもたらす音声表現の選択がどのように影響するかを評価すること。
  • トレーニング用のソースおよびターゲットスピーカー発話数を変化させた場合のコンバージョン品質への影響を評価すること。
  • 主観的評価を通じて、提案手法がVAE-STFTおよびGMMベースラインと比較して、音声品質およびスピーカー類似度においてどのように性能を発揮するかを評価すること。

提案手法

  • 本手法は、スピーカーIDと言語的文脈を分離可能な潜在表現として学習する因子化された階層的変分オートエンコーダー(FHVAE)を採用する。
  • スピーカーIDの潜在コードは1つのターゲットスピーカー発話から、言語的文脈の潜在コードはソーススピーカー発話からそれぞれ推論される。
  • モデルは、ソース発話の言語的コンテンツとターゲット発話のスピーカー固有表現を組み合わせることで、ターゲットスピーカーの声を再構築する。
  • 音声表現はメル倒頻スペクトル(MCEP)およびその他の音響特徴を用いて評価され、World音声コーディングがSTFTよりも優れた性能を示した。
  • フレームワークはマルチスピーカーデータでトレーニングされ、最小限のターゲットデータでの1ショット推論用にファインチューニングされる。
  • 主観的評価では、平均意見評価(MOS)および同一/異種スピーカー類似度テストを用い、音声品質およびスピーカー識別子の保持度を評価する。

実験結果

リサーチクエスチョン

  • RQ1分離可能で解釈可能な表現を用いることで、1つのターゲットスピーカー発話のみで効果的な1ショットクロスリンガルボイスコンバージョンが可能になるか?
  • RQ2音声表現の選択(例:World音声コーディング vs. STFT)がボイスコンバージョンの品質および類似度にどのように影響するか?
  • RQ3ターゲットスピーカーからのトレーニング発話数を1つに減らした場合の性能低下または安定性はいかがなっているか?
  • RQ4提案手法は、VAE-STFTおよびGMMベースラインと比較して、主観的音声品質およびスピーカー類似度においてどのように性能を発揮するか?
  • RQ5異なる言語および性別の組み合わせにおいて、クロスリンガル設定でモデルの汎化性能は十分に高いか?

主な発見

  • 主観的音声品質テストにおいて、提案手法はVAE-STFTに対して平均MOSスコアで+1.25 ± 0.12の向上を示し、p < 0.0001であり、顕著な改善が確認された。
  • GMMベースラインと比較して、提案手法は平均MOSで+0.61 ± 0.14の向上を示したが、すべての言語および性別ペアにおいてp < 0.05であった。
  • World音声コーディングは、音声品質およびスピーカー類似度の両面でSTFTを上回り、ボイスコンバージョンの表現学習において優位性を示した。
  • ターゲットスピーカー発話が1つしかない状況でも、妥当な性能を達成しており、音声品質においてベースラインを著しく上回った。
  • スピーカー類似度テストでは、GMMとVAEシステムの間に統計的に有意な差は認められず、それぞれ-0.12 ± 0.16(VAE)および-0.18 ± 0.15(GMM)のスコアを示したが、E2Eコンバージョンが最も高いスピーカー識別子保持度を示した。
  • Z2Z(同じ言語)コンバージョンは、クロスリンガルペア(E2Z、Z2E)よりも高い類似度スコアを達成しており、聴取者の認識に言語一致バイアスが存在する可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。