Skip to main content
QUICK REVIEW

[論文レビュー] Controllable Person Image Synthesis with Spatially-Adaptive Warped Normalization

Jichao Zhang, Aliaksandr Siarohin|arXiv (Cornell University)|May 31, 2021
Generative Adversarial Networks and Image Synthesis参考文献 65被引用数 7
ひとこと要約

本稿では、人物画像生成におけるポーズ特徴とスタイル特徴の間の空間的不整合を解消するために、学習されたフロー場を用いてスタイル調製パラメータ(スケールおよびバイアス)をワープする空間的適応型歪み正規化(SAWN)という新しい正規化モジュールを提案する。さらに、自己学習的パーツ交換(STPR)戦略を導入し、モデルを精緻化することで、DeepFashionデータセットにおけるポーズ転送および複雑なテクスチャ転送タスクで最先端の性能を達成した。トップスではFIDスコアが10.50、ヘアでは11.32にまで低下した。

ABSTRACT

Controllable person image generation aims to produce realistic human images with desirable attributes such as a given pose, cloth textures, or hairstyles. However, the large spatial misalignment between source and target images makes the standard image-to-image translation architectures unsuitable for this task. Most state-of-the-art methods focus on alignment for global pose-transfer tasks. However, they fail to deal with region-specific texture-transfer tasks, especially for person images with complex textures. To solve this problem, we propose a novel Spatially-Adaptive Warped Normalization (SAWN) which integrates a learned flow-field to warp modulation parameters. It allows us to efficiently align person spatially-adaptive styles with pose features. Moreover, we propose a novel Self-Training Part Replacement (STPR) strategy to refine the model for the texture-transfer task, which improves the quality of the generated clothes and the preservation ability of non-target regions. Our experimental results on the widely used DeepFashion dataset demonstrate a significant improvement of the proposed method over the state-of-the-art methods on pose-transfer and texture-transfer tasks. The code is available at https://github.com/zhangqianhui/Sawn.

研究の動機と目的

  • 人物画像生成におけるポーズ特徴とスタイル特徴の間の空間的不一致を、特に複雑なテクスチャに対して解消すること。
  • 非ターゲット領域のアイデンティティを保持しつつ、人物画像合成におけるテクスチャ転送品質を向上させること。
  • 自己教師付きパーツ交換によるモデル精緻化により、学習と推論の間のドメインギャップを低減すること。
  • ポーズガイドドおよび領域特化型テクスチャ転送タスクの両方で最先端の性能を達成すること。

提案手法

  • 空間的適応型歪み正規化(SAWN)を提案。正規化のスケールおよびバイアスパラメータを学習されたフロー場を用いてワープし、空間的位置ごとにスタイル特徴とポーズ特徴を正確に一致させる。
  • SAWNの変種として、部位特化マスクを用いてテクスチャ転送中に領域特化型の空間的整合性を実現するM-SAWNを導入。
  • スタイル特徴をポーズガイドド特徴マップと一致させるための密な空間変換(フロー場)を予測するネットワークを活用。
  • 複数のデコーダースケールにわたりSAWNを適用することで、異なる受容野で細粒度のスタイル整合性を維持。
  • 同じ人物の異なるポーズにおけるパーツを交換することで、域内ファインチューニングを実行する自己学習的パーツ交換(STPR)戦略を導入。
  • 生成器がポーズ、外見、領域マスクを条件として、リアルな人物画像を合成できるGANフレームワークを用いた adversarial training を実施。

実験結果

リサーチクエスチョン

  • RQ1学習されたフロー場は、人物画像生成におけるテクスチャ転送の向上を目的として、空間的適応型スタイルパラメータをポーズ特徴と効果的に一致させることができるか?
  • RQ2正規化におけるスケールとバイアスの両方をワープすることで、スケールのみをワープする場合よりも性能が向上するか?
  • RQ3自己学習的パーツ交換戦略は、学習と推論の乖離を低減させ、リアルさとアイデンティティ保持性を向上させることができるか?
  • RQ4提案手法は、ポーズおよびテクスチャ転送における複雑なテクスチャの処理において、SOTA手法と比較してどのように優れているか?

主な発見

  • 提案されたSAWN手法は、DeepFashionデータセットでFIDスコア11.54を達成し、ベースラインのSAN(14.99)およびSAWS(12.04)を上回った。
  • SAWNとSTPRを併用したフルモデルは、「Tops」領域でFID10.50、「Hair」領域でFID11.32を達成し、リアルさと詳細転送の向上が顕著に確認された。
  • STPR戦略により、「Tops」ではFIDが5.22ポイント低下、「Pants」では1.68ポイント低下し、品質向上に有効であることが示された。
  • 可視化結果から、学習されたフロー場およびオクルージョンマスクが妥当なワープ結果を生成しており、ターゲット人物の形状と外見をよく再現していることが確認された。
  • ADGAN や PISE と比較して、赤白のチェック柄のような複雑なパターンでも、本手法はよりシャープなテクスチャを生成した。
  • アブレーションスタディの結果、スケールとバイアスの両方をワープする(SAWN)手法が、スケールのみをワープする(SAWS)手法よりも優れていることが確認され、全パラメータのワープの必要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。