Skip to main content
QUICK REVIEW

[論文レビュー] XOGAN: One-to-Many Unsupervised Image-to-Image Translation

Yongqi Zhang|arXiv (Cornell University)|May 18, 2018
Generative Adversarial Networks and Image Synthesis参考文献 3被引用数 5
ひとこと要約

XOGANは、色やテクスチャの多様な変化を制御する分離された潜在変数Zを導入することで、一対のトレーニングデータが不要な一対多の教師なし画像対画像翻訳を解決する条件付き生成的対抗ネットワークを提案する。このモデルは、エッジから靴、エッジからハンドバッグ、CelebAデータセットにおいて、サイクル整合性とドメイン対抗学習を維持しながら、色の置換を含む制御可能な画像翻訳を可能にする。

ABSTRACT

Unsupervised image-to-image translation aims at learning the relationship between samples from two image domains without supervised pair information. The relationship between two domain images can be one-to-one, one-to-many or many-to-many. In this paper, we study the one-to-many unsupervised image translation problem in which an input sample from one domain can correspond to multiple samples in the other domain. To learn the complex relationship between the two domains, we introduce an additional variable to control the variations in our one-to-many mapping. A generative model with an XO-structure, called the XOGAN, is proposed to learn the cross domain relationship among the two domains and the ad- ditional variables. Not only can we learn to translate between the two image domains, we can also handle the translated images with additional variations. Experiments are performed on unpaired image generation tasks, including edges-to-objects translation and facial image translation. We show that the proposed XOGAN model can generate plausible images and control variations, such as color and texture, of the generated images. Moreover, while state-of-the-art unpaired image generation algorithms tend to generate images with monotonous colors, XOGAN can generate more diverse results.

研究の動機と目的

  • 一対のトレーニングデータが存在しない状況で、1つの入力画像が複数の出力画像にマッピング可能な一対多の教師なし画像対画像翻訳の課題に対処すること。
  • ペairedデータが存在しない状況でも、色やテクスチャのような複雑で多様な画像の変化をモデル化すること。
  • 追加の潜在変数Zを用いてコンテンツと属性要因を分離することで、制御可能な画像生成を実現すること。
  • 忠実なドメイン間翻訳と現実的な画像合成を保証するため、サイクル整合性とドメイン対抗学習を維持すること。

提案手法

  • 二つの生成器 $G_A: \mathcal{B} \rightarrow \mathcal{A}$ と $G_B: (\mathcal{A}, Z) \rightarrow \mathcal{B}$ を備えた 'XO' 構造のGANアーキテクチャを導入し、双方向翻訳を可能にする。
  • 生成画像の変化を制御するため、標準正規分布からサンプリングされた潜在変数 $Z \sim \mathcal{N}(0, I)$ を用いる。
  • 再構築された画像と元の画像の間の整合性を保つために、サイクル整合性損失を適用する。
  • 生成画像が $\mathcal{B}$ の実画像と分布的に区別できないようにするために、ドメイン対抗損失を実装する。
  • ドメイン間を往復して翻訳する際にコンテンツを保存するために、アイデンティティ損失を用いる。
  • 実画像と生成画像を区別するための識別器を用い、現実的な画像品質を保証する。

実験結果

リサーチクエスチョン

  • RQ1教師なし翻訳においてペairedデータが存在しない状況でも、1つの入力から多様な出力を得られる生成モデルは、一対多の画像翻訳を学習できるか?
  • RQ2分離された潜在変数は、色やテクスチャのような特定の画像属性を、教師なし翻訳においてどのように制御できるか?
  • RQ3潜在コードZを操作することで、色の置換(例:色の交換)をどの程度正確に実現できるか?
  • RQ4サイクル整合性とドメイン対抗学習の組み合わせは、ペアのない翻訳において画像の精細さと多様性を向上させるか?
  • RQ5エッジから靴、エッジからハンドバッグ、顔の属性編集といった多様な画像翻訳タスクに、モデルは一般化可能か?

主な発見

  • XOGANモデルは、エッジから靴、靴からエッジへの両方向翻訳において、一貫した形状と多様な色を有する高精細な画像を効果的に生成する。
  • 潜在コード $Z$ は色などの画像属性を効果的に符号化できており、$Z$ を交換することで1枚の画像の色を別の画像の色に置換する色の置換が可能になる。
  • 同じ $Z$ を異なるエッジ入力に適用した場合、モデルは一貫した色を持つオブジェクトを生成し、制御性が裏付けられる。
  • モデルは、一対のない翻訳において、単調な色の出力を避けるなど、最先端の未ペア翻訳手法を上回る多様な結果を生成する。
  • サイクル整合性損失とドメイン対抗損失が併用されることで、現実的で忠実な画像生成と正確なドメインマッピングが保証される。
  • edges2shoes、edges2handbags、CelebAにおける実験から、$Z$ は意味的かつ分離可能であることが属性転送と視覚的一致性によって裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。