Skip to main content
QUICK REVIEW

[論文レビュー] Image-to-image Translation via Hierarchical Style Disentanglement

Xinyang Li, Shengchuan Zhang|arXiv (Cornell University)|Mar 2, 2021
Generative Adversarial Networks and Image Synthesis参考文献 51被引用数 9
ひとこと要約

本稿では、画像間翻訳のための新規フレームワークである階層的スタイル分離(HiSD)を提案する。このフレームワークは、独立したタグと排他的な属性にラベルを階層的ツリー構造で整理することで、分離された、制御可能なスタイル操作を可能にする。アテンションマスクと条件付き識別器を用いた教師なし分離によりタグ関連のスタイルを学習し、グローバルまたはアイデンティティ保持のアーチファクトを生じさせることなく、現実的で多様かつ正確な翻訳を実現する。CelebA-HQで検証された結果、定性的および定量的に最先端の性能を達成した。

ABSTRACT

Recently, image-to-image translation has made significant progress in achieving both multi-label (\ie, translation conditioned on different labels) and multi-style (\ie, generation with diverse styles) tasks. However, due to the unexplored independence and exclusiveness in the labels, existing endeavors are defeated by involving uncontrolled manipulations to the translation results. In this paper, we propose Hierarchical Style Disentanglement (HiSD) to address this issue. Specifically, we organize the labels into a hierarchical tree structure, in which independent tags, exclusive attributes, and disentangled styles are allocated from top to bottom. Correspondingly, a new translation process is designed to adapt the above structure, in which the styles are identified for controllable translations. Both qualitative and quantitative results on the CelebA-HQ dataset verify the ability of the proposed HiSD. We hope our method will serve as a solid baseline and provide fresh insights with the hierarchically organized annotations for future research in image-to-image translation. The code has been released at https://github.com/imlixinyang/HiSD.

研究の動機と目的

  • 既存のマルチラベル・マルチスタイル画像間翻訳手法における独立性および排他性の欠如に起因する、アイデンティティや背景の変更といった制御不能な操作を是正すること。
  • 各タグ(例:メガネ、髪の色)が明確に分離され、解釈可能で独立した視覚的スタイルに関連付けられるように、スタイル表現を分離すること。
  • 教師付きアノテーションを必要とせず、個々の属性に対して正確な制御が可能な、潜在変数ガイドドおよびリファレンスベースのスタイル変換を可能にすること。
  • アテンションマスクとタグ無関係識別器を用いることで、グローバルな操作や暗黙の属性漏れを防ぐ訓練フレームワークを設計すること。

提案手法

  • ラベルを階層的構造に整理する:独立タグ(例:'With_Bangs')と排他的属性(例:'Blond_Hair' 対 'Black_Hair')を用い、属性とスタイルを別々にモデル化可能にする。
  • 局所的トランスレーターがアテンションマスクを用いてスタイル操作を局所的な画像領域に制限することで、グローバルおよびアイデンティティ保持のアーチファクトを低減する。
  • 生成器が関係のない余分なラベルを操作しないようにするため、タグ無関係の条件付き識別器を導入する。
  • 潜在コード生成(マッパー・ネットワークを介して)とリファレンス画像ベースのスタイル抽出(スタイルエンコーダーを用いて)の2つのスタイル生成モードをサポートする。
  • サイクル整合性とスタイル整合性損失を適用し、生成および抽出されたスタイルがアイデンティティとコンテンツ忠実度を保持することを保証する。
  • 訓練安定性を高めるために、ResBlocks、AdaIN層、Hinge損失およびR1正則化を用いた修正されたGANアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ1階層的ラベル構造は、画像間翻訳における独立的・排他的な属性のためのスタイル分離を効果的に実現できるか?
  • RQ2タグ関連スタイルの教師なし分離により、アイデンティティや背景のアーチファクトを伴わず、制御可能で多様かつ現実的な画像翻訳が可能になるか?
  • RQ3学習されたスタイル空間における連続的補間により、未観測のスタイル組み合わせへの一般化が可能になるか?
  • RQ4アテンションマスクとタグ無関係識別器の使用は、分離性の向上および制御不能なグローバル操作の低減にどのように寄与するか?
  • RQ5リファレンス画像から抽出されたスタイルコードは、教師なし条件下でも正確で多様なスタイル変換を可能にするか、その程度はいかほどか?

主な発見

  • 提案されたHiSDフレームワークは、CelebA-HQで最先端の性能を達成し、複数の属性およびスタイルにおいて多様で現実的な翻訳を生成した。
  • 抽出されたタグ関連スタイルコード間の補間により滑らかな遷移が得られ、学習されたスタイル空間の連続性および分離性を裏付けた。
  • t-SNE可視化では、明示的な属性監視がなくても、同じ属性のためのスタイルコードが埋め込み空間でクラスタを形成していた。
  • StarGANv2およびSDITとの定性的比較により、翻訳中にアイデンティティや背景の変更を効果的に回避していることが確認された。
  • フレームワークは潜在変数ガイドドおよびリファレンスベースの両方のスタイル変換を可能にし、さまざまな属性操作において一貫した性能を示した。
  • アブレーションスタディにより、局所的トランスレーターとタグ無関係識別器の両方が、制御不能なグローバル操作の低減および分離性の向上に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。