Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Person Image Synthesis in Arbitrary Poses

Albert Pumarola, Antonio Agudo|arXiv (Cornell University)|Sep 27, 2018
Generative Adversarial Networks and Image Synthesis参考文献 37被引用数 17
ひとこと要約

本論文は、1枚の入力画像と2次元ポーズスケルトンからの任意のポーズにおける写真のようにリアルな人物画像を合成する、完全に教師なしのGANベースのフレームワークを提案する。コンテンツとスタイルの知覚を組み込んだ双方向サイクル整合性損失を活用することで、ペaired訓練データを必要とせず、高精細な画像を生成する。DeepFashionデータセットにおいて、教師あり手法と同等の性能を達成した。

ABSTRACT

We present a novel approach for synthesizing photo-realistic images of people in arbitrary poses using generative adversarial learning. Given an input image of a person and a desired pose represented by a 2D skeleton, our model renders the image of the same person under the new pose, synthesizing novel views of the parts visible in the input image and hallucinating those that are not seen. This problem has recently been addressed in a supervised manner, i.e., during training the ground truth images under the new poses are given to the network. We go beyond these approaches by proposing a fully unsupervised strategy. We tackle this challenging scenario by splitting the problem into two principal subtasks. First, we consider a pose conditioned bidirectional generator that maps back the initially rendered image to the original pose, hence being directly comparable to the input image without the need to resort to any training image. Second, we devise a novel loss function that incorporates content and style terms, and aims at producing images of high perceptual quality. Extensive experiments conducted on the DeepFashion dataset demonstrate that the images rendered by our model are very close in appearance to those obtained by fully supervised approaches.

研究の動機と目的

  • 1枚の画像からペaired訓練データを必要とせずに、新しいポーズにおけるリアルな人物画像を生成する課題に対処すること。
  • 教師ありデータの必要性を排除し、入力画像とポーズスケルトンのみで学習するGANモデルを訓練すること。
  • ポーズ変更に伴っても、アイデンティティ、テクスチャ、スタイルを保持しながら、隠れた身体部位を hallucinate すること。
  • 知覚品質と意味的整合性を保証するための新しい損失関数を開発すること。
  • 教師なし学習が、完全に教師ありの最先端手法に近い性能を達成できることを示すこと。

提案手法

  • モデルはポーズ条件付きの双方向ジェネレータを用い、入力ポーズからターゲットポーズへ画像をレンダリングした後、再び元のポーズへ戻すことでサイクル整合性を確保する。
  • コンテンツ損失、スタイル損失、アイデンティティ保持損失を組み合わせた新しい損失関数により、知覚的品質と意味的忠実度を確保する。
  • 敵対的損失を前向きおよび逆向きの生成経路の両方へ適用し、現実性を強制する。
  • コンテンツおよびスタイルの知覚損失を計算するために、事前学習済みのVGGネットワークの特徴マップを使用する。
  • アイデンティティ損失は、ポーズ変換に伴う人物のアイデンティティを保持するように特に設計されており、標準的なL1損失に代わる。
  • 本モデルは、ペアの正解画像を一切必要とせず、単一の画像とポーズスケルトンのみでエンドツーエンドに学習される。

実験結果

リサーチクエスチョン

  • RQ1ペアの訓練画像を必要とせずに、GANベースのモデルが任意のポーズにおける高品質で写真のようにリアルな人物画像を生成できるか?
  • RQ2サイクル整合性と知覚損失をどのように組み合わせることで、大きなポーズ変化下でもアイデンティティと外観を保持できるか?
  • RQ3教師なしモデルは、人物画像生成分野における教師あり最先端手法の性能にどの程度近づけるか?
  • RQ4教師なし人物画像生成の失敗モードは何か。テクスチャマッピングと幾何的整合性との関係は?
  • RQ5背景が複雑な画像に対しても、バックグラウンドフリーのデータで学習したモデルは一般化可能か?

主な発見

  • 提案された教師なしモデルは、DeepFashionデータセットにおいて、完全に教師ありの最先端手法と同等の画像品質を達成した。
  • 入力とターゲットポーズが著しく異なる場合でも、顔や四肢の完全なホールスラシオンを含め、実際の画像を効果的に合成できた。
  • アイデンティティ損失を標準的なL1損失に置き換えると、顕著なアイデンティティ崩壊が発生し、生成画像が一般化された「平均的」な人物に収束するようになる。これはアイデンティティ損失の重要性を示している。
  • 背景がある画像に対しても、モデルは妥当な一般化を示し、一貫性のある人物の形状とテクスチャを生成したが、背景固有の監視がないため、背景が過剰に滑らかに処理された。
  • アブレーションスタディにより、コンテンツ、スタイル、アイデンティティ、サイクル整合性損失の各要素が高精細な生成に不可欠であることが確認された。
  • 失敗事例には、テクスチャの不整合(例:ズボンが脚にマッピングされる)、顔の不完全なレンダリング、幾何的ポーズエラー、身体部位のテクスチャ転送が含まれ、自己遮蔽と形状整合性の課題を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。