Skip to main content
QUICK REVIEW

[論文レビュー] AGAIN-VC: A One-shot Voice Conversion using Activation Guidance and Adaptive Instance Normalization

Yen-Hao Chen, Da-Yi Wu|arXiv (Cornell University)|Oct 31, 2020
Speech Recognition and Synthesis参考文献 25被引用数 4
ひとこと要約

AGAIN-VCは、活性化ガイドランスと適応的インスタンス正規化を用いた単一エンコーダーを用いたワンショット音声変換システムを提案する。コンテンツ埋め込みに学習可能なシグモイド活性化関数を適用することで、ソフトな情報ボトルネックを形成し、話者とコンテンツの表現を分離する。この手法により、二重エンコーダーを搭載するモデルを凌駕する最先端の性能を達成するとともに、モデルサイズを30%削減した。

ABSTRACT

Recently, voice conversion (VC) has been widely studied. Many VC systems use disentangle-based learning techniques to separate the speaker and the linguistic content information from a speech signal. Subsequently, they convert the voice by changing the speaker information to that of the target speaker. To prevent the speaker information from leaking into the content embeddings, previous works either reduce the dimension or quantize the content embedding as a strong information bottleneck. These mechanisms somehow hurt the synthesis quality. In this work, we propose AGAIN-VC, an innovative VC system using Activation Guidance and Adaptive Instance Normalization. AGAIN-VC is an auto-encoder-based model, comprising of a single encoder and a decoder. With a proper activation as an information bottleneck on content embeddings, the trade-off between the synthesis quality and the speaker similarity of the converted speech is improved drastically. This one-shot VC system obtains the best performance regardless of the subjective or objective evaluations.

研究の動機と目的

  • ワンショット音声変換における合成品質と話者・コンテンツの分離性能のトレードオフを解消すること。
  • インスタンス正規化層のチャネル別平均μと標準偏差σを再利用することで、別個の話者エンコーダーの必要性を排除すること。
  • 活性化ガイドランスを導入し、話者関連情報がコンテンツ埋め込みに漏れ込むのを防ぐ、ソフトで学習可能な情報ボトルネックを提供すること。
  • 統合的で単一エンコーダー構造を採用することで、モデルの効率性と性能を向上させること。
  • 客観的指標と主観的人間評価の両面で最先端の結果を達成すること。

提案手法

  • 単一エンコーダーがインスタンス正規化(IN)層を用いて、コンテンツ表現と話者表現の両方を抽出する。ここで、チャネル別平均μと標準偏差σが話者埋め込みとして機能する。
  • 適応的インスタンス正規化(AdaIN)は、デコード段階でターゲット埋め込みからの話者スタイルをコンテンツ特徴に転送する。
  • 活性化ガイドランスは、ハイパーパラメータαを有する学習可能なシグモイド関数をコンテンツ埋め込みに適用し、連続的でソフトな情報ボトルネックとして機能させ、話者関連情報を抑制する。
  • モデルは再構成損失で訓練される:ℒ = ||X − X̂||₁。入力と出力のメルスペクトログラムの差を最小化する。
  • 活性化関数は学習中に最適化され、α = 0.1が分離性能と再構成の両立において最良のバランスを示した。
  • 別個の話者エンコーダーとコンテンツエンコーダーを回避することで、モデルサイズを削減しながらも性能を維持または向上させた。

実験結果

リサーチクエスチョン

  • RQ1単一エンコーダーは、ワンショット音声変換において話者とコンテンツの表現を効果的に分離できるか?
  • RQ2学習可能なシグモイド関数による活性化ガイドランスは、合成品質を劣化させることなく分離性能を向上させるか?
  • RQ3二重エンコーダーベースライン(例:AdaIN-VC)と比較して、提案手法は性能とモデル効率性の面で優れているか?
  • RQ4活性化ガイドランス関数における最適なハイパーパラメータαは、話者類似度とコンテンツ忠実度のバランスをどのようにとるか?
  • RQ5提案手法は、客観的指標と主観的人間評価の両方で優れた結果を達成するか?

主な発見

  • 提案された1-Enc-sigモデルは、すべての構成の中で最小の再構成誤差(0.151)を達成し、1-Encおよび2-Encベースラインを上回った。
  • 活性化ガイドランスを適用した結果、コンテンツ埋め込みの話者分類精度は1.7%に低下し、話者情報のほぼ完全な分離が確認された。
  • 話者埋め込みでは93.2%の話者分類精度を達成しており、有効な話者表現学習が行われたことが裏付けられた。
  • 主観評価では、自然さ(MOS)と話者類似度の両面で、1-Encおよび2-Encベースラインを顕著に上回るスコアを記録した。
  • 単一エンコーダー構造により、モデルサイズが30%削減(9.5Mパラメータ)されたが、性能に劣化は見られなかった。
  • α = 0.1のシグモイド関数が最適であることが判明。情報フィルタリングとコンテンツ保持の両立が図られ、ReLU、ELU、Tanhを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。