Skip to main content
QUICK REVIEW

[論文レビュー] Emerging Disentanglement in Auto-Encoder Based Unsupervised Image Content Transfer

Ori Press, Tomer Galanti|arXiv (Cornell University)|Jan 14, 2020
Generative Adversarial Networks and Image Synthesis被引用数 20
ひとこと要約

本稿では、共有コンテンツとドメイン固有のコンテンツに分離することで、分離表現を達成する単一エンコーダ・単一デコーダの自動オーケストレータアーキテクチャを提案する。ドメイン固有の成分をソースドメインの画像に対してゼロにすることで、ターゲットドメインの参照画像を用いて、眼鏡や顔のひげといった構造的属性を高い忠実度で効果的に転送する。複雑な損失関数の設計を必要とせず、先行研究を上回る分離度と再構成品質を達成する。

ABSTRACT

We study the problem of learning to map, in an unsupervised way, between domains A and B, such that the samples b in B contain all the information that exists in samples a in A and some additional information. For example, ignoring occlusions, B can be people with glasses, A people without, and the glasses, would be the added information. When mapping a sample a from the first domain to the other domain, the missing information is replicated from an independent reference sample b in B. Thus, in the above example, we can create, for every person without glasses a version with the glasses observed in any face image. Our solution employs a single two-pathway encoder and a single decoder for both domains. The common part of the two domains and the separate part are encoded as two vectors, and the separate part is fixed at zero for domain A. The loss terms are minimal and involve reconstruction losses for the two domains and a domain confusion term. Our analysis shows that under mild assumptions, this architecture, which is much simpler than the literature guided-translation methods, is enough to ensure disentanglement between the two domains. We present convincing results in a few visual domains, such as no-glasses to glasses, adding facial hair based on a reference image, etc.

研究の動機と目的

  • ソースドメインに存在しないが、ターゲットドメインに追加の構造的コンテンツを含む非教師付き画像変換を解決すること。
  • ドメインBからの1枚の参照画像を用いて、ドメインAからドメインBへのコンテンツ転送を可能とし、追加されたコンテンツが忠実に再現されることを保証すること。
  • 最小限のアーキテクチャと損失関数を用いて、共有コンテンツとドメイン固有の属性に分離された表現を達成すること。
  • 弱い仮定のもとで分離が自然に出現することを示し、複雑なサイクル整合性や敵対的制約の必要性を排除すること。
  • 複数のネットワークや複雑な損失項に依存する既存のガイド付き変換手法の単純な代替案を提供すること。

提案手法

  • 共有の二パスウェイエンコーダが両ドメインを処理し、共有コンテンツ表現とドメイン固有表現を生成する。
  • すべてのソースドメインサンプル(ドメインA)に対してドメイン固有成分をゼロに設定することで、共有コンテンツと固有コンテンツの分離を強制する。
  • 1つの共有デコーダが結合表現から画像を再構成し、両ドメインでの再構成を可能にする。
  • 訓練目的は両ドメインの再構成損失と、共有表現学習を促進するドメイン混同損失のみを用いる。
  • モデルはAからBへの片方向マッピングを実行し、Bドメインの参照画像を用いてドメイン固有コンテンツを注入する。
  • 本手法は双方向動作をサポートする:Bドメインの (e₁(b), 0) をデコードすることでドメイン固有コンテンツを除去する。

実験結果

リサーチクエスチョン

  • RQ1共有エンコーダとデコーダを有する最小限のオートエンコーダアーキテクチャが、非教師付き画像変換において分離表現を達成できるか?
  • RQ2ソースドメインの画像に対してドメイン固有成分をゼロにすることで、明示的な正則化なしに分離が自然に出現するか?
  • RQ3再構成損失とドメイン混同項のみを含むシンプルな損失関数が、高品質なガイド付きコンテンツ転送を達成できるか?
  • RQ4眼鏡や顔のひげといった構造的属性の転送において、最先端手法と比較してどのように性能を発揮するか?
  • RQ5本モデルはコンテンツ転送(A→B)と特徴除去(B→A)の両方で使用可能か?また、既存の分離モデルと比較してどうか?

主な発見

  • 本モデルはガイド付き画像変換において最先端の性能を達成しており、定量的評価では眼鏡や顔のひげといった構造的属性の正確な転送が確認された。
  • ユーザー研究の結果、眼鏡の除去においてFaderネットワークよりも92%の支持率、顔のひげでは89%、笑顔の除去では91%の支持率を示した。
  • 分類器の結果、本手法で変換されたAドメインの画像に対してBドメインの確率は平均0.011であり、Faderネットワークの0.066よりも顕著に低く、ターゲットドメイン特徴の効果的な除去を示している。
  • 最小限の損失項で高品質な分離を達成しており、分離がアーキテクチャ設計と重み共有から自然に出現することを示している。
  • 補間実験により、共有コンテンツ表現が線形に補間可能であることが確認され、分離された表現の妥当性が裏付けられた。
  • 失敗事例は主にソース画像またはガイド画像の不整合に起因しており、モデルの頑健性は画像のアライメントに依存している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。