Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Audiovisual Synthesis via Exemplar Autoencoders

Kangle Deng, Aayush Bansal|arXiv (Cornell University)|Jan 13, 2020
Speech and Audio Processing参考文献 70被引用数 4
ひとこと要約

本稿では、3分間のターゲット音声・映像データのみを用いて、任意の入力話者からターゲット話者へのゼロショット音声および顔面アニメーション転送を可能にする、例示的自動符号化器(Exemplar Autoencoders)を提案する。入力話者の分布外の音声をターゲット話者のスタイルに投影するパーソナライズドなボトルネック表現を学習することで、入力話者データや大規模データセットにおけるファインチューニングを必要とせず、音声および映像合成の両面で最先端の結果を達成する。

ABSTRACT

We present an unsupervised approach that converts the input speech of any individual into audiovisual streams of potentially-infinitely many output speakers. Our approach builds on simple autoencoders that project out-of-sample data onto the distribution of the training set. We use Exemplar Autoencoders to learn the voice, stylistic prosody, and visual appearance of a specific target exemplar speech. In contrast to existing methods, the proposed approach can be easily extended to an arbitrarily large number of speakers and styles using only 3 minutes of target audio-video data, without requiring {\em any} training data for the input speaker. To do so, we learn audiovisual bottleneck representations that capture the structured linguistic content of speech. We outperform prior approaches on both audio and video synthesis, and provide extensive qualitative analysis on our project page -- https://www.cs.cmu.edu/~exemplar-ae/.

研究の動機と目的

  • 入力話者用の訓練データを必要とせず、任意の入力話者からターゲット話者へのゼロショット音声視覚合成を可能にすること。
  • 言語的コンテンツと話者固有のスタイルおよびプロソディを分離するパーソナライズドな音声視覚ボトルネック表現を学習すること。
  • スケーラブルに任意の多数の話者に適用可能な、ターゲットデータのみ3分間で高精細な音声および映像合成を達成すること。
  • ウェブ上のリアルなデータ(in-the-wild)において、ゼロショットおよび教師ありアプローチを上回る音声品質および視覚的リアリズムを達成すること。
  • ヘルスケア、教育、エンターテインメント分野における即時利用可能でデータ効率の良いソリューションを提供すること。

提案手法

  • 本手法は、1つのターゲット話者の音声視覚データの分布に、小さなボトルネック表現を用いて分布外の入力音声を投影する例示的自動符号化器を採用する。
  • 自動符号化器は、ターゲットの声、プロソディ、視覚的外観を再構築しながら言語的コンテンツを保持するように、3分間のターゲット音声・映像データ上でエンドツーエンドに訓練される。
  • 音声ボトルネックは構造的な音素的コンテンツを捉え、任意の入力話者からターゲットへのコンテンツ保持型スタイル転送を可能にする。
  • 映像合成は、音声ボトルネックに条件付けられた映像デコーダーを共同で訓練することで実現し、高品質なリアリズムを得るために事前学習済みの音声特徴を活用する。
  • 高精細な音声再構築のため、WaveNet音声生成器を用い、事前学習済みの話者埋め込みに依存せず、リアルなスタイルの詳細を捉える。
  • 本手法はデータ効率が高く、再訓練やペアドデータなしで未学習の話者および言語に一般化可能である。

実験結果

リサーチクエスチョン

  • RQ13分間のターゲット音声・映像データでのみ訓練可能な1つの自動符号化器が、任意の入力話者に対して高品質な音声視覚合成を可能にするか?
  • RQ2小さなボトルネックを介して入力音声をターゲットの分布に投影することで、言語的コンテンツを保持しながらスタイルを転送できるか?
  • RQ3ターゲット話者から学習した音声ボトルネックが、追加の訓練データなしで実際の顔面映像を効果的に合成できるか?
  • RQ4Exemplar Autoencodersの性能は、ゼロショットおよび教師ありベースラインと比較して、声の類似性およびコンテンツの一貫性の観点で優れているか?
  • RQ5本手法は、未加工のウェブデータ(in-the-wild)にも一般化可能で、話者固有のファインチューニングなしに高品質な合成を達成できるか?

主な発見

  • WaveNetを用いた場合、Celeb-Audioデータセットで99.6%の声の類似度スコアを達成し、Auto-VC(98.5%)およびChouら(57.0%)を上回る話者分類精度を示した。
  • WaveNetを用いた場合、平均コサイン距離(MCD)は420.3と、Auto-VC(408.8)よりわずかに高いが、依然として高い聴覚的品質を達成した。
  • WaveNetを使用しない場合でも、非WaveNetベースラインを上回り、97.0%の声の類似度と420.3のMCDを達成し、音声生成器選択に対して高い頑健性を示した。
  • 映像合成において、音声デコーダーのファインチューニングを併せて行うことで性能が向上し、VoxCelebでMSEが76.401に低下し、PSNRが29.616に上昇した。
  • アブレーションスタディにより、事前学習済み音声モデルの使用および音声ボトルネックのファインチューニングが、初期化から訓練するか、映像ヘッドのみを訓練する場合よりも顕著に映像合成品質を向上させた。
  • 人間評価では、本手法の出力がマルチスプリーカー自動符号化器よりも90.6%の割合で好まれ、優れたスタイル転送とリアリズムを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。