Skip to main content
QUICK REVIEW

[論文レビュー] Attribute Guided Unpaired Image-to-Image Translation with Semi-supervised Learning

Xinyang Li, Jie Hu|arXiv (Cornell University)|Apr 29, 2019
Generative Adversarial Networks and Image Synthesis参考文献 35被引用数 11
ひとこと要約

本論文は、半教師あり学習と分離表現学習を統合することで翻訳の細粒度制御を可能にする、新たな属性誘導型非対応画像間翻訳モデルAGUITを提案する。ラベル付き属性とラベルなしデータをサイクル整合性を通じて活用し、ガウス分布とドメインラベル分布からの連続的・分離可能な成分にスタイルを分解することで、マルチドメイン・マルチモーダル翻訳において優れた性能を達成し、ゼロショット属性翻訳の新しいベンチマークとして分離された転送を導入する。

ABSTRACT

Unpaired Image-to-Image Translation (UIT) focuses on translating images among different domains by using unpaired data, which has received increasing research focus due to its practical usage. However, existing UIT schemes defect in the need of supervised training, as well as the lack of encoding domain information. In this paper, we propose an Attribute Guided UIT model termed AGUIT to tackle these two challenges. AGUIT considers multi-modal and multi-domain tasks of UIT jointly with a novel semi-supervised setting, which also merits in representation disentanglement and fine control of outputs. Especially, AGUIT benefits from two-fold: (1) It adopts a novel semi-supervised learning process by translating attributes of labeled data to unlabeled data, and then reconstructing the unlabeled data by a cycle consistency operation. (2) It decomposes image representation into domain-invariant content code and domain-specific style code. The redesigned style code embeds image style into two variables drawn from standard Gaussian distribution and the distribution of domain label, which facilitates the fine control of translation due to the continuity of both variables. Finally, we introduce a new challenge, i.e., disentangled transfer, for UIT models, which adopts the disentangled representation to translate data less related with the training set. Extensive experiments demonstrate the capacity of AGUIT over existing state-of-the-art models.

研究の動機と目的

  • 完全に教師ありデータを必要とする既存の非対応画像間翻訳(UIT)モデルの限界を克服し、明示的なドメイン情報の符号化を欠如している点を是正する。
  • ラベル付きデータとラベルなしデータを活用する半教師あり学習フレームワークを導入し、高価なアノテーションへの依存度を低減する。
  • ガウスノイズとドメインラベルからの連続的・独立的な成分にスタイルを分解することで、細粒度制御が可能な画像翻訳を実現する。
  • モデルが訓練中に見未曾な関連のないコンテンツ(例:動物に眼鏡を装着する)に属性を翻訳するという、新たな評価チャレンジ「分離された転送」を提案する。

提案手法

  • ラベル付き画像からラベルなし画像への属性翻訳を実行し、その後サイクル整合性を用いてラベルなし画像を再構築することで、特徴の一貫性を強制する、新しい半教師あり学習スキームを提案する。
  • 画像表現をドメインに依存しないコンテンツコードとドメイン固有のスタイルコードに分解し、スタイルは標準ガウス分布に従うノイズベクトルと連続的ドメインラベル分布の組み合わせとしてモデル化する。
  • 各次元が独立した明確な属性に対応するようにスタイルコードを学習することで、分離性を強制し、独立した操作を可能にする。
  • 翻訳中の再構築忠実度を保証し、ドメイン間での特徴整合性と頑健性を向上させるために、サイクル整合性損失を適用する。
  • スタイルコードに教師あり(ラベル付き属性)および教師なし(ノイズ)の両成分を統合することで、制御可能かつ多様な出力を可能にする。
  • 敵対的損失、サイクル整合性損失、再構築損失を用いてジェネレータとディスクラミネータをエンドツーエンドで訓練し、学習の安定化と翻訳品質の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1半教師あり学習フレームワークは、ラベル付きデータの制限下でも非対応画像間翻訳の性能を向上させ、ラベル付きデータへの依存度を低下させることができるか?
  • RQ2分離されたスタイル表現(コンテンツとドメイン固有属性の分離)は、細粒度制御が可能な画像翻訳を実現できるか?
  • RQ3モデルはゼロショット属性転送に一般化可能か?例えば、人間の顔の属性(例:眼鏡)を訓練時に見なかった動物に適用できるか?
  • RQ4本手法の二重スタイル符号化(ガウス分布+ドメインラベル)は、従来のスタイル符号化手法と比較して、分離性および制御性において優れているか?
  • RQ5半教師あり学習スキームは、限られたラベル付きデータ下で表現学習と翻訳品質をどの程度向上させるか?

主な発見

  • AGUITはマルチドメインおよびマルチモーダル画像翻訳において最先端の性能を達成し、CycleGAN、StarGAN、MUNIT、SMITなどのモデルを定量的および定性的に上回る。
  • 半教師あり学習スキームにより、限られたラベル付きデータ下でも翻訳品質が著しく向上し、属性翻訳とサイクル整合性を活用したラベルなしデータの有効活用の有効性が示された。
  • 教師ありスタイルコードの分離により、細粒度制御が可能である:個々の属性次元に沿った補間は、劣化を伴わずに滑らかで意味のある出力画像の変化をもたらす。
  • スタイルコードのノイズ成分を用いた非教師あり属性分離により、照明やヘアスタイルなどの属性を手動アノテーションの必要なく分離可能となった。
  • AGUITは成功裏に分離された転送(例:人間の顔から猫や犬に眼鏡を移動)を実行し、アイデンティティと構造を保持したが、CycleGAN、StarGAN、MUNITは失敗または歪みを生じた。
  • モデルの分離表現により、干渉を最小限に抑えた高精細で解釈可能な翻訳が可能であり、二重スタイル符号化戦略の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。