Skip to main content
QUICK REVIEW

[論文レビュー] Latent Translation: Crossing Modalities by Bridging Generative Models

Yingtao Tian, Jesse Engel|arXiv (Cornell University)|Feb 21, 2019
Generative Adversarial Networks and Image Synthesis参考文献 34被引用数 14
ひとこと要約

本論文では、ブリッジ変分オートエンコーダを用いて共有潜在空間を学習することで、異なるモダリティ間(例:画像→音声)や生成モデルの種類間(VAE→GAN)の変換を可能にする「潜在翻訳」を提案する。構造的整合性のためのスライスド・ワサーライン距離と、意味的整合性のための分類器を用いることで、ベースモデルの再訓練と比較して約200倍高速化されながらも、98%に達する高い変換精度を達成した。

ABSTRACT

End-to-end optimization has achieved state-of-the-art performance on many specific problems, but there is no straight-forward way to combine pretrained models for new problems. Here, we explore improving modularity by learning a post-hoc interface between two existing models to solve a new task. Specifically, we take inspiration from neural machine translation, and cast the challenging problem of cross-modal domain transfer as unsupervised translation between the latent spaces of pretrained deep generative models. By abstracting away the data representation, we demonstrate that it is possible to transfer across different modalities (e.g., image-to-audio) and even different types of generative models (e.g., VAE-to-GAN). We compare to state-of-the-art techniques and find that a straight-forward variational autoencoder is able to best bridge the two generative models through learning a shared latent space. We can further impose supervised alignment of attributes in both domains with a classifier in the shared latent space. Through qualitative and quantitative evaluations, we demonstrate that locality and semantic alignment are preserved through the transfer process, as indicated by high transfer accuracies and smooth interpolations within a class. Finally, we show this modular structure speeds up training of new interface models by several orders of magnitude by decoupling it from expensive retraining of base generative models.

研究の動機と目的

  • 事前学習済みの生成モデルをモジュール的・組み合わせ的に新規のクロスモダリティタスクに適用可能にするために、再訓練を伴わないモジュール化された使用を可能にすること。
  • クロスモダリティドメイン変換中に局所性と意味的整合性を保持すること。
  • 基本モデルの再訓練からインターフェース学習を分離することで、訓練コストを削減すること。
  • 異なる生成モデルアーキテクチャ間(例:VAEからGANへ)の変換を可能にすること。
  • 教師ありデータに依存することを最小限に抑えるために、教師なしの整合性と半教師あり学習を活用すること。

提案手法

  • 2つのドメインからのデータを共通の潜在空間にエンコードする共有ブリッジVAEを訓練する。
  • スライスド・ワサーライン距離(SWD)を用いて、共有潜在空間における2つのドメインの周辺分布の重なりを促進する。
  • ドメインに依存するデコーダは、1-of-Kラベルを用いてどのドメインの分布を再構築するかを制御する。
  • 共有潜在空間に配置された線形分類器が、両ドメインからのクラスラベルを予測することで意味的整合性を強制する。
  • 再構築損失、SWDペナルティ、分類損失の組み合わせでモデルを訓練する。
  • 変換は、ソースドメインのサンプルをターゲットドメインのラベルでエンコードし、ターゲットドメインでデコードすることで実現する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの生成モデル間のクロスモダリティ変換を可能にするために、共有潜在空間を学習できるか?
  • RQ2転送された表現において、局所性と意味的整合性はどの程度保持されるか?
  • RQ3教師なしおよび半教師あり信号の影響は、変換性能にどのように現れるか?
  • RQ4インターフェースの訓練は、基本生成モデルの再訓練と比べてどの程度高速化されるか?
  • RQ5異なる種類の生成モデル(例:VAEからGANへ)を接続できるか?

主な発見

  • ブリッジVAEは、6000個のラベル付き例を用いたMNISTからMNISTへの変換で98.0%の変換精度を達成し、高い意味的整合性を示した。
  • クラス1つあたり10個のラベル付き例のみで、変換精度は52.4%に達し、優れたデータ効率性を示した。
  • ラベルなしでも、スライスド・ワサーライン距離による教師なし整合性のおかげで13.9%の精度を達成した。
  • ベースのWaveGANモデルを再訓練するのと比較して、インターフェースの訓練時間を約200倍短縮した。
  • 補間結果から、クラス内では滑らかで局所的な遷移が実現され、クラス境界では制御されたジャンプが観察され、局所性が保持された。
  • アブレーションスタディの結果、ドメイン条件付き制御とSWDの両方が性能向上に顕著に寄与しており、特にドメイン条件付き制御が精度向上の主な要因であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。