Skip to main content
QUICK REVIEW

[論文レビュー] Recapture as You Want

Chen Gao, Si Liu|arXiv (Cornell University)|Jun 2, 2020
Generative Adversarial Networks and Image Synthesis参考文献 45被引用数 7
ひとこと要約

本稿では、GANに基づくポートレート再捕獲手法を提案し、ユーザーがポーズ、ボディーフィギュア、衣装スタイルを意図するように編集できるようにする。セマンティックに注意を払った幾何変換と外見変換を可能にするために、2つの新規モジュールを導入する。すなわち、部品内特徴の整合化を図るセマンティックに注意を払ったアテンショントランスファー(SAT)と、部品間関係をモデル化するレイアウトグラフリason(LGR)である。非剛性変形に対処し、見えない身体部位を推定し、グローバルな一貫性を保つ。DeepFashion、Market-1501、およびリアルな状況下のデータセットにおいて、アイデンティティ保持と視覚的リアリズムの面で最先端の結果を達成した。

ABSTRACT

With the increasing prevalence and more powerful camera systems of mobile devices, people can conveniently take photos in their daily life, which naturally brings the demand for more intelligent photo post-processing techniques, especially on those portrait photos. In this paper, we present a portrait recapture method enabling users to easily edit their portrait to desired posture/view, body figure and clothing style, which are very challenging to achieve since it requires to simultaneously perform non-rigid deformation of human body, invisible body-parts reasoning and semantic-aware editing. We decompose the editing procedure into semantic-aware geometric and appearance transformation. In geometric transformation, a semantic layout map is generated that meets user demands to represent part-level spatial constraints and further guides the semantic-aware appearance transformation. In appearance transformation, we design two novel modules, Semantic-aware Attentive Transfer (SAT) and Layout Graph Reasoning (LGR), to conduct intra-part transfer and inter-part reasoning, respectively. SAT module produces each human part by paying attention to the semantically consistent regions in the source portrait. It effectively addresses the non-rigid deformation issue and well preserves the intrinsic structure/appearance with rich texture details. LGR module utilizes body skeleton knowledge to construct a layout graph that connects all relevant part features, where graph reasoning mechanism is used to propagate information among part nodes to mine their relations. In this way, LGR module infers invisible body parts and guarantees global coherence among all the parts. Extensive experiments on DeepFashion, Market-1501 and in-the-wild photos demonstrate the effectiveness and superiority of our approach. Video demo is at: \url{https://youtu.be/vTyq9HL6jgw}.

研究の動機と目的

  • プロフェッショナルな写真編集ツールを必要とせず、ユーザーが意図するポーズ、ボディーフィギュア、衣装スタイルに簡単にポートレートを編集できるようにすること。
  • 内在的な外見とアイデンティティを保持しつつ、非剛性人体変形の課題に対処すること。
  • 可視領域とセマンティックレイアウトに基づいて、見えない身体部位(例:下半身)を一貫して推定すること。
  • セマンティックに注意を払った編集中に、すべての身体部位のグローバルな一貫性を保つこと。
  • ドメインのシフトに強く、リアルな状況下のポートレート(in-the-wild)に対しても効果的に適用可能な方法を開発すること。

提案手法

  • 本手法は、条件付きGANフレームワークを用いて、ポートレート再捕獲をセマンティックに注意を払った幾何変換と外見変換に分解する。
  • 部品レベルの編集をガイドするための空間的制約をエンコードするセマンティックレイアウトマップを生成する。
  • セマンティックに注意を払ったアテンショントランスファー(SAT)モジュールは、ソース画像内の意味的に整合する領域に注目することで、部品内特徴のトランスファーを実行し、非剛性変形下でもテクスチャと構造を保持する。
  • レイアウトグラフリason(LGR)モジュールは、ボディースケルトン知識からグラフを構築し、部品特徴を接続して部品間の関係をモデル化し、グラフメッセージパッシングにより見えない部位を推定する。
  • 詳細とグローバルな一貫性のバランスを図るため、マルチスケール特徴(層 l=3,4,5)を用い、最適な設定(DeepFashionでは l=3, r=6, n=2;Market-1501では l=4, r=6, n=2)を採用する。
  • リアルな状況下のポートレートに対しては、フォアグラウンドのセグメンテーションを実行し、人体部分に再捕獲モデルを適用した後、市販のインpaintingモデルを用いて背景を再構築する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、ポーズ、ボディーフィギュア、衣装スタイルを同時にセマンティックに注意を払った編集で効果的に処理できるか?
  • RQ2アイデンティティと詳細なテクスチャの詳細を保持しつつ、人体の非剛性変形をどのようにモデル化できるか?
  • RQ3制限された可視領域から、見えない身体部位をどれほど正確かつ一貫して推定できるか?
  • RQ4セマンティックに注意を払った編集中に、すべての人体部位のグローバルな一貫性をどのように維持できるか?
  • RQ5本手法は、実世界の制約のない(in-the-wild)ポートレート画像にも一般化可能か?

主な発見

  • SATモジュールは、特に大きなポーズやスケールの変化下でも、外見構造の保持とテクスチャの詳細の一貫性を顕著に向上させる。
  • LGRモジュールは、見えない身体部位の推定を効果的に行い、グローバルな一貫性を向上させる。たとえば、一致する靴の色や、可視領域と推定領域での一貫した肌の色を保証する。
  • アブレーションスタディの結果、最適なパフォーマンスは、SATを中程度の特徴(l=3)で、LGRを高レベルの特徴(l=4)で使用した場合に達成され、r=6 および n=2 が最良のハイパーパramータであることが示された。
  • DeepFashionおよびMarket-1501において、FIDおよびLPIPSの指標で優れた定量的結果を達成し、画像品質とリアリズムの両面で優れた性能を示した。
  • フォアグラウンド・バックグラウンド分離とバックグラウンドのインpaintingを経て、リアルな状況下のポートレートに対しても、良好に一般化され、現実的かつ一貫性のある結果を生成した。
  • フレームごとの適用による動画再捕獲では、安定的で視覚的に一貫した結果が得られ、モデルの時間的スケールでのロバスト性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。