Skip to main content
QUICK REVIEW

[論文レビュー] Attention-GAN for Object Transfiguration in Wild Images

Xinyuan Chen, Chang Xu|arXiv (Cornell University)|Mar 19, 2018
Generative Adversarial Networks and Image Synthesis参考文献 29被引用数 5
ひとこと要約

本稿では、オブジェクト検出とスタイル変換を統合的に処理する従来のGANの限界を克服するため、注意予測と画像変換を分離した、新たなGANフレームワークAttention-GANを提案する。本手法は、スパースでオブジェクトに焦点を当てたマスクを生成する専用の注意ネットワークと、注目領域にのみスタイル変換を施す変換ネットワークを用い、従来手法に比べて画像品質と背景の一貫性が著しく向上する。

ABSTRACT

This paper studies the object transfiguration problem in wild images. The generative network in classical GANs for object transfiguration often undertakes a dual responsibility: to detect the objects of interests and to convert the object from source domain to target domain. In contrast, we decompose the generative network into two separat networks, each of which is only dedicated to one particular sub-task. The attention network predicts spatial attention maps of images, and the transformation network focuses on translating objects. Attention maps produced by attention network are encouraged to be sparse, so that major attention can be paid to objects of interests. No matter before or after object transfiguration, attention maps should remain constant. In addition, learning attention network can receive more instructions, given the available segmentation annotations of images. Experimental results demonstrate the necessity of investigating attention in object transfiguration, and that the proposed algorithm can learn accurate attention to improve quality of generated images.

研究の動機と目的

  • 従来のGANがオブジェクト変容において、1つの生成器がオブジェクト検出とスタイル変換の両方を処理するため、画像品質が劣化するという限界を是正すること。
  • 注意予測と画像変換のタスクを分離することで、背景の一貫性とオブジェクトの局在精度を向上させること。
  • 関連する画像領域にのみ注目するスパースで学習可能な注意メカニズムを用いることで、より正確で解釈可能なオブジェクト変容を実現すること。
  • セグメンテーションアノテーションを用いて注意ネットワークを監督することで、弱教師あり設定下での性能向上を検討すること。

提案手法

  • 生成ネットワークを2つの別々のネットワークに分解する:空間的注意マップを予測する注意ネットワークと、注目領域に対してドメイン変換を実行する変換ネットワーク。
  • スパース正則化損失を適用し、注意マップが散らかった背景領域ではなく、顕著なオブジェクトに集中するよう促進する。
  • 要素ごとの乗算と加算の階層的処理を用い、予測された注意マスクを介して変換済みオブジェクトと元の背景を合成する。
  • 対応データが存在しない場合に備えてサイクル整合性損失を採用し、変換が可逆であり構造的一致性が保たれることを保証する。
  • 変換前後で注意マップが変化しないように制約を課す注意的サイクル整合性損失を導入し、空間的一致性を維持する。
  • 教師ありおよび教師なしの両方の学習をサポートする。教師あり設定では、注意ネットワークを正例セグメンテーションマスクで学習させ、局在精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1注意予測と画像変換を分離することで、野生の画像におけるオブジェクト変容の品質と一貫性が向上するか?
  • RQ2注意マップに対するスパース正則化は、オブジェクトの局在と背景の保持にどのように影響するか?
  • RQ3セグメンテーションアノテーションによる監視は、オブジェクト変容における注意ネットワークの性能にどの程度向上効果をもたらすか?
  • RQ4提案されたAttention-GANは、CycleGANなどの最先端手法に比べ、画像品質および構造的忠実度の面で優れているか?

主な発見

  • λattn = 5 の条件下で、馬→シマウマタスクにおいてPSNRが24.2173、SSIMが0.9367を達成し、ベースライン手法に比べ顕著な向上を示した。
  • λattn = 1 の設定で、オブジェクトカバレッジと背景の一貫性のバランスが最良となり、低・高正則化設定よりも優れた性能を示した。
  • セグメンテーションマスクによる教師あり学習により、より正確な注意マップが得られ、濃い赤・青のマスクは高信頼度のオブジェクト検出を示し、背景への干渉が減少した。
  • 定性的な結果から、教師なしAttention-GANおよびCycleGANは顔の領域を誤ってターゲットとし、ストライプ状に変換してしまうが、本手法ではこれらの領域を正しく保持していることが確認された。
  • アブレーションスタディにより、スパース損失が不可欠であることが確認された。この損失がなければ、注意マップが誤って背景領域を強調し、画像品質が劣化する。
  • 中間特徴の可視化により、最終出力が元の背景と変換済みオブジェクトの合成であることが裏付けられ、階層的処理の有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。