[論文レビュー] VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion
本稿では、ベクトル量子化(VQCPC)と相互情報量(MI)最小化を用いて、コンテンツ、話者、ピッチ要因間の相関を低減する、教師なしワンショット音声変換手法VQMIVCを提案する。再構成、VQCPC、MIの損失を同時に最適化することで、言語的コンテンツと発音の抑揚を保持しつつ、音声の自然さと話者類似度が向上し、客観的および主観的評価の両面で最先端手法を上回る性能を達成する。
One-shot voice conversion (VC), which performs conversion across arbitrary speakers with only a single target-speaker utterance for reference, can be effectively achieved by speech representation disentanglement. Existing work generally ignores the correlation between different speech representations during training, which causes leakage of content information into the speaker representation and thus degrades VC performance. To alleviate this issue, we employ vector quantization (VQ) for content encoding and introduce mutual information (MI) as the correlation metric during training, to achieve proper disentanglement of content, speaker and pitch representations, by reducing their inter-dependencies in an unsupervised manner. Experimental results reflect the superiority of the proposed method in learning effective disentangled speech representations for retaining source linguistic content and intonation variations, while capturing target speaker characteristics. In doing so, the proposed approach achieves higher speech naturalness and speaker similarity than current state-of-the-art one-shot VC systems. Our code, pre-trained models and demo are available at https://github.com/Wendison/VQMIVC.
研究の動機と目的
- ワンショット音声変換における音声表現間の情報漏洩、特にコンテンツ情報が話者埋め込みに汚染される問題に対処すること。
- テキストの発音変換や話者ラベルなどの教師信号を一切用いずに、コンテンツ、話者、ピッチ要因の有効な分離を可能にすること。
- 訓練中に分離された表現間の相互情報量を最小化することで、音声変換品質を向上させること。
- 言語的コンテンツと元の抑揚を保持しつつ、正確にターゲット話者の特徴を転送することで、高精細なワンショット音声変換を達成すること。
提案手法
- フレームレベルの言語的コンテンツ表現を抽出するために、対照的予測符号化(CPC)を用いたベクトル量子化(VQCPC)に基づくコンテンツエンコーダを採用する。
- 生の音響特徴から固定次元のベクトル表現を生成する話者エンコーダを用い、話者アイデンティティを捉える。
- 発話レベルでの正規化された基本周波数(F₀)を計算することで、抑揚の変化を保持する。
- 分離されたコンテンツ、話者、ピッチ表現からメルスペクトログラムを再構成するデコーダを採用する。
- 再構成損失、VQCPC損失(局所的音声構造のモデル化)、および相互情報量(MI)損失の3つの損失成分を用いてモデルを訓練する。
- 変分的対照的対数尤度上界(vCLUB)を用いて相互情報量を最小化することで、教師なしの方法で分離を強制する。
実験結果
リサーチクエスチョン
- RQ1相互情報量の最小化は、ワンショット音声変換におけるコンテンツ、話者、ピッチ表現間の相関を効果的に低減できるか?
- RQ2VQCPCとMIを用いた教師なし分離は、ワンショットVCにおけるコンテンツ保持性と抑揚の一貫性をどのように向上させるか?
- RQ3従来の教師なし分離手法と比較して、MIに基づく正則化は情報漏洩をどの程度軽減できるか?
- RQ4ピッチ表現の導入により、変換時の元のプロソディ(抑揚)の保持が向上するか?
- RQ5最先端のワンショットVCシステムと比較して、本手法は音声の自然さと話者類似度の面でどの程度優れているか?
主な発見
- 提案手法VQMIVCは、変換音声において語誤り率(WER)が29.3%、文字誤り率(CER)が14.9%と最低を記録し、AutoVC、AdaIN-VC、VQVC+を著しく上回った。
- 元のF₀カーブと変換されたF₀カーブのピアソン相関係数(PCC)は0.781であり、抑揚の変化の強力な保持を示している。
- 相互情報量正則化なし(w/o MI)の条件では、WERが62.1%、CERが38.0%に上昇し、MI最小化がコンテンツ漏洩を防ぐために不可欠であることを示している。
- 主観的MOS評価では、本手法が音声の自然さ(平均スコア4.2)と話者類似度(平均スコア4.3)においてAutoVCやVQVC+を上回り、オラクル性能に近い結果を得た。
- アブレーションスタディにより、MI正則化が表現間の相関を低減し、より正確な分離と向上したVC品質をもたらすことが確認された。
- 本システムは、多様な話者ペairにおいても高い性能を維持しており、話者ラベルや発音変換なしにゼロショットおよびワンショット設定でも堅牢であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。