Skip to main content
QUICK REVIEW

[論文レビュー] Mask Based Unsupervised Content Transfer

Ron Mokady, Sagie Benaim|arXiv (Cornell University)|Jun 15, 2019
Generative Adversarial Networks and Image Synthesis参考文献 48被引用数 5
ひとこと要約

本稿では、生成されたマスクによって誘導される新しいアテンションメカニズムを用いて、ドメイン不変のコンテンツとドメイン固有のコンテンツを分離する、マスクベースの教師なしコンテンツ転送手法を提案する。この手法により、画像全体の再構築を伴わず、局所的なコンテンツ転送が可能となり、高品質な転送が実現される。本手法はコンテンツ転送の品質と多様性において最先端の結果を達成するとともに、クラスレベルのアノテーションのみを用いて弱教師ありセマンティックセグメンテーションも可能である。

ABSTRACT

We consider the problem of translating, in an unsupervised manner, between two domains where one contains some additional information compared to the other. The proposed method disentangles the common and separate parts of these domains and, through the generation of a mask, focuses the attention of the underlying network to the desired augmentation alone, without wastefully reconstructing the entire target. This enables state-of-the-art quality and variety of content translation, as demonstrated through extensive quantitative and qualitative evaluation. Our method is also capable of adding the separate content of different guide images and domains as well as remove existing separate content. Furthermore, our method enables weakly-supervised semantic segmentation of the separate part of each domain, where only class labels are provided. Our code is publicly available at https://github.com/rmokady/mbu-content-tansfer.

研究の動機と目的

  • 一方のドメインに他方には存在しない追加の属性(例:眼鏡)が含まれる非ペairedドメイン間での教師なしコンテンツ転送を解決すること。
  • ネットワークの注目を、関連する領域に限定することで、不要な詳細の再構築を避けて生成品質を向上させること。
  • 画像間で属性の追加・削除・交換が可能な柔軟なコンテンツ操作を可能にすること。
  • クラスレベルのラベルのみを用いて、転送されたコンテンツの弱教師ありセマンティックセグメンテーションを可能にすること。
  • ペairedトレーニングデータや明示的なセグメンテーションアノテーションを必要とせずに、コンテンツとスタイルの分離を達成すること。

提案手法

  • ドメイン不変のコンテンツ(ドメイン間で共有される)とドメイン固有のコンテンツ(各ドメイン固有)を分離する、自己符号化器に類似したアーキテクチャを用いる。
  • マスク生成ネットワークが、ドメイン固有のコンテンツを追加すべきターゲット画像内の空間的領域を特定し、局所的注目を可能にするとともに、再構築の負担を軽減する。
  • サイクル整合性、両ドメインの再構築損失、および、意味的分離を保証するための新しい分離損失($\mathcal{L}_{DC}$)の組み合わせによりトレーニングを行う。
  • ターゲットドメインに自己正則化損失($\mathcal{L}^{A}_{Recon2}$)を適用し、マスクが関連するコンテンツのみを捉えるよう促進することで、マスクのスパarsityと正確性を向上させる。
  • 潜在空間がドメイン固有のコンテンツを意味的に認識しているため、正確な局所化と高精細な転送が可能である。
  • 生成されたマスクはコンテンツ転送の目的だけでなく、境界ボックスやピixeレベルのアノテーションを一切不要として、弱教師ありセマンティックセグメンテーションにも利用される。

実験結果

リサーチクエスチョン

  • RQ1非ペアドドメイン間で、画像全体の再構築を伴わず、高品質で多様なコンテンツ転送を達成できるか?
  • RQ2注目マスクを用いてコンテンツ転送を特定の領域に局所化することで、生成品質と効率性が向上するか?
  • RQ3生成されたマスクは、クラスレベルのアノテーションのみを用いて、弱教師ありセマンティックセグメンテーションマップとして機能するか?
  • RQ4本手法はコンテンツの追加と削除を両方可能とし、画像間での柔軟な属性交換を実現できるか?
  • RQ5異なる損失成分がマスク品質、分離性、および転送性能にどのように影響を与えるか?

主な発見

  • 本手法は、定量的指標と定性的な評価の両面で、先行する教師なし手法を上回る、コンテンツ転送の品質と多様性において最先端の性能を達成した。
  • 転送されたコンテンツ(例:眼鏡、顔のひげ)のセマンティックセグメンテーションにおける交差領域(IoU)は、先行する弱教師あり手法を上回り、眼鏡では平均IoUが0.881、顔のひげでは0.885を記録した。
  • アブレーションスタディの結果、$\mathcal{L}^{A}_{Recon2}$損失を除去すると分類器の正確度が9.7%低下し、マスクの局所化と分離性においてその重要性が示された。
  • $\mathcal{L}_{Cycle}$損失を除いた場合、平均して顔の29%がマスクでカバーされるが、分類器の正確度は67.1%に低下し、サイクル整合性が意味的正確性を維持するのを助けることが示された。
  • 本手法は、トレーニングドメイン外の画像に対してもコンテンツ転送を成功させ、強力な一般化性と耐障害性を示した。
  • 生成されたマスクは、任意のグランドトゥルースセグメンテーションの監視なしに、弱教師ありセマンティックセグメンテーションに十分な正確性を有しており、高いIoUを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。