Skip to main content
QUICK REVIEW

[論文レビュー] Learning Disentangled Representations with Reference-Based Variational Autoencoders

Adrià Ruiz, Oriol Martínez|arXiv (Cornell University)|Jan 24, 2019
Generative Adversarial Networks and Image Synthesis参考文献 38被引用数 19
ひとこと要約

本稿では、ターゲット要因が一定である補助リファレンスセットを活用することで、明示的なアノテーションを必要とせずに、分離可能な表現を学習する弱教師付き手法であるリファレンスベース変分オートエンコーダー(Rb-VAEs)を提案する。対称KLダイバージェンスと adversarial 学習を用いてVAEの目的関数を再定式化することで、共通要因からターゲット要因(例:顔の表情、数字のスタイル)を効果的に分離でき、標準VAEに比べて条件付き生成や属性転送の性能が顕著に向上する。

ABSTRACT

Learning disentangled representations from visual data, where different high-level generative factors are independently encoded, is of importance for many computer vision tasks. Solving this problem, however, typically requires to explicitly label all the factors of interest in training images. To alleviate the annotation cost, we introduce a learning setting which we refer to as "reference-based disentangling". Given a pool of unlabeled images, the goal is to learn a representation where a set of target factors are disentangled from others. The only supervision comes from an auxiliary "reference set" containing images where the factors of interest are constant. In order to address this problem, we propose reference-based variational autoencoders, a novel deep generative model designed to exploit the weak-supervision provided by the reference set. By addressing tasks such as feature learning, conditional image generation or attribute transfer, we validate the ability of the proposed model to learn disentangled representations from this minimal form of supervision.

研究の動機と目的

  • 視覚的データにおける高レベルの生成的要因を分離するための高いアノテーションコストを低減するための弱教師付き学習設定を導入すること。
  • 標準VAEがリファレンスベース分離に適用された際の退化問題を克服するための新しい訓練目的を提案すること。
  • ターゲット要因が固定されたリファレンス画像のみを用いて、ターゲット要因を共通要因から分離した表現を学習すること。
  • 特徴表現学習、条件付き画像生成、属性転送といった下流タスクにおいて、手法の有効性を検証すること。

提案手法

  • ターゲット要因が一定であるリファレンスセットのみを用いる弱教師付き設定として、リファレンスベース分離を導入。ターゲット要因の明示的ラベルは不要。
  • リファレンスベース変分オートエンコーダー(Rb-VAEs)を提案。潜在空間をターゲット要因(e)と共通要因(z)の2つに分割する深層生成モデル。
  • 標準VAEの目的関数がこの設定で失敗するメカニズムを是正するため、対称KLダイバージェンスを用いた目的関数を採用。
  • 生成器の品質向上を図るため、敵対的学習を用いる。
  • 再構成損失と敵対的損失の組み合わせを用いてモデルを訓練し、現実的な画像生成を保証。
  • zを固定したままe潜在コードを操作することで、条件付き画像合成と属性転送にモデルを適用。

実験結果

リサーチクエスチョン

  • RQ1ターゲット要因が一定であるリファレンスセットのみを用いて、明示的なラベルなしに分離可能な表現を学習できるか?
  • RQ2標準VAEの目的関数がリファレンスベース分離設定で失敗する理由は何か? その失敗を克服する代替訓練目的は何か?
  • RQ3対称KLダイバージェンスと敵対的学習が、この弱教師付き設定において、分離性と生成品質の両方を向上させることができるか?
  • RQ4学習された表現が、標準VAEに比べて、条件付き画像生成や属性転送といった下流タスクにおいて、どの程度有効に機能するか?
  • RQ5提案手法は、弱教師付き条件下で、先行研究の最先端手法を上回る性能を示すか?

主な発見

  • 標準VAEの目的関数は、リファレンスベース設定において退化解を生じさせ、結果として分離性が低く、下流タスクでの性能も弱くなる。
  • 訓練目的に対称KLダイバージェンスを用いることで、属性予測タスクの成績が向上し、分離性が著しく向上することが示された。
  • sRb-VAE(対称KLを用いるモデル)は、Rb-VAE(標準VAE)に比べて優れた分離性を達成し、AffectNetでは平均属性予測精度.335、MNISTでは.189を達成。
  • sRb-VAEを用いた条件付き画像生成では、Rb-VAEに比べてより多様で現実的な表情の変化やスタイルの変動を再現でき、特にスケールや動的な顔の特徴のモデル化において優れている。
  • 属性転送の実験では、sRb-VAEは数字のスタイルや顔の表情といったターゲット要因を効果的に転送できるが、Rb-VAEはスケール関連の属性を正しく転送できない。
  • 定性的な結果から、sRb-VAEはターゲット要因(e)を共通要因(z)からより効果的に分離できており、高レベルの属性の操作がより効果的に行えることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。