Skip to main content
QUICK REVIEW

[論文レビュー] Pose Guided Fashion Image Synthesis Using Deep Generative Model

Wei Sun, Jawadul H. Bappy|arXiv (Cornell University)|Jun 17, 2019
Generative Adversarial Networks and Image Synthesis参考文献 38被引用数 10
ひとこと要約

本稿では、人物のポーズを転送しながら衣類の外観を保持する、写真のようにリアルなファッション画像合成のための深層生成モデルを提案する。二重エンコーダー生成器(画像およびポーズエンコーダー)を用い、画像のリアルさを評価するディスクライミネーターと、ポーズ外観の一貫性を検証する別のディスクライミネーターを備えることで、DeepFashionおよびMarket-1501データセットで最先端のインセプションスコアと高いSSIMを達成した。

ABSTRACT

Generating a photorealistic image with intended human pose is a promising yet challenging research topic for many applications such as smart photo editing, movie making, virtual try-on, and fashion display. In this paper, we present a novel deep generative model to transfer an image of a person from a given pose to a new pose while keeping fashion item consistent. In order to formulate the framework, we employ one generator and two discriminators for image synthesis. The generator includes an image encoder, a pose encoder and a decoder. The two encoders provide good representation of visual and geometrical context which will be utilized by the decoder in order to generate a photorealistic image. Unlike existing pose-guided image generation models, we exploit two discriminators to guide the synthesis process where one discriminator differentiates between generated image and real images (training samples), and another discriminator verifies the consistency of appearance between a target pose and a generated image. We perform end-to-end training of the network to learn the parameters through back-propagation given ground-truth images. The proposed generative model is capable of synthesizing a photorealistic image of a person given a target pose. We have demonstrated our results by conducting rigorous experiments on two data sets, both quantitatively and qualitatively.

研究の動機と目的

  • 指定されたターゲットポーズを伴う写真的ファッション画像を合成する深層生成モデルを開発すること。
  • 同じファッションアイテムの複数枚の画像を活用して視覚的・意味的文脈を学習することで、ポーズガイドド画像合成を改善すること。
  • 二重ディスクライミネーター構造を用いて、画像品質とポーズの一貫性を向上させること。
  • 生成器とディスクライミネーターの共同最適化を可能にするエンドツーエンドの訓練を可能にすること。
  • 単一画像入力への依存を減らし、より豊かな特徴学習が可能なマルチビュー画像シーケンスを活用すること。

提案手法

  • 同じファッションアイテムの複数枚の画像間で視覚的・意味的特徴を学ぶために、双方向畳み込みLSTM(bC-LSTM)を備えた生成器を採用する。
  • U-Netエンコーダーを用いて、入力画像とポーズマップからコンactな外観および幾何的表現を抽出する。
  • 二つのディスクライミネーターを配置する:一方(D_I)は実画像と生成画像を区別し、写真的リアルさを強制する。もう一方(D_P)はポーズ外観の一貫性を検証する。
  • 敵対的損失と知覚的再構成損失を用いて、バックプロパゲーションによるエンドツーエンドの訓練を実施する。
  • 画像生成中に空間的詳細を保持するために、デコーダーにU-Net風のスキップ接続を統合する。
  • 訓練中に真値画像とポーズマップを監視として活用し、合成プロセスをガイドする。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、衣類の外観を保持しつつ、正確なポーズ転送を伴う写真的ファッション画像を合成できるか?
  • RQ2同じファッションアイテムの複数枚の画像を用いることで、視覚的・意味的特徴学習と合成品質はどのように向上するか?
  • RQ3リアルさとポーズ一貫性の両方を専用に処理する二つのディスクライミネーターの導入が、画像品質と忠実度に与える影響は何か?
  • RQ4多様なデータセットにおいて、インセプションスコアとSSIMの観点から、本手法は最先端の手法と比較してどのように差をつけるか?
  • RQ5複雑なポーズ変化に対しても、顔の詳細をリアルに再現し、一貫性を保てるか、その限界はどこか?

主な発見

  • 本手法は、DeepFashionデータセットで10.28という最先端のインセプションスコアを達成し、PG²(1.77)、PG²(G1+D)(2.11)、pix2pix(2.55)、変分U-Net(3.02)を大きく上回った。
  • Market-1501データセットでは、SSIMスコアが0.892を記録し、単一画像ベースラインから9.90ポイントの向上を達成した。
  • ポーズ一貫性ディスクライミネーター(D_P)の導入により、D_Pを搭載しないアブレーションモデルと比較して、SSIMが9.38%向上した。
  • マルチイメージモデル(M)は、DeepFashionにおいて単一画像モデル(S)よりも0.89%高いSSIMを達成し、マルチビュー特徴学習の有効性を示した。
  • 定性的な結果から、顔の特徴(目、鼻、口)がリアルに再現され、多様なポーズにおいても正確なポーズ転送が実現していることが確認された。
  • 背景の変化に対してもモデルの頑健性が確認され、ターゲット画像に背景情報が欠落しているにもかかわらず、Market-1501で高い性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。