Skip to main content
QUICK REVIEW

[論文レビュー] TryOnGAN: Body-Aware Try-On via Layered Interpolation

Kathleen M. Lewis, Srivatsan Varadharajan|arXiv (Cornell University)|Jan 6, 2021
Generative Adversarial Networks and Image Synthesis参考文献 14被引用数 4
ひとこと要約

TryOnGANは、100万枚の未ペアデータを用いたスタイル変換可能なStyleGAN2ベースの新規手法であり、各レイヤーの潜在空間補間を用いて身体に合わせた衣類の移動を実現し、512×512解像度の画像において、ペア学習データを一切不要とすることで最先端の性能を達成した。顔貌、肌色、ボディーシェイプを保持しながら、自然に衣類を融合させることが可能であり、最適化されたレイヤー固有の補間係数のおかげで、実写および生成画像の両方で優れた性能を発揮する。

ABSTRACT

Given a pair of images-target person and garment on another person-we automatically generate the target person in the given garment. Previous methods mostly focused on texture transfer via paired data training, while overlooking body shape deformations, skin color, and seamless blending of garment with the person. This work focuses on those three components, while also not requiring paired data training. We designed a pose conditioned StyleGAN2 architecture with a clothing segmentation branch that is trained on images of people wearing garments. Once trained, we propose a new layered latent space interpolation method that allows us to preserve and synthesize skin color and target body shape while transferring the garment from a different person. We demonstrate results on high resolution 512x512 images, and extensively compare to state of the art in try-on on both latent space generated and real images.

研究の動機と目的

  • 従来の仮想試着手法がボディーシェイプの変形、肌色の一貫性、自然な衣類融合を無視するという限界を是正すること。
  • ペア学習データを必要とせず、高解像度(512×512)の画像において高精細な試着を実現する手法を開発すること。
  • ターゲット人物の顔貌とボディー構造を保持しつつ、複雑な衣類のテクスチャーやパターンを正確に転送すること。
  • 各レイヤーごとに最適な補間係数を自動的に計算する潜在空間最適化戦略を設計すること。
  • 未ペアデータを用いて、多様なボディータイプ、ポーズ、衣類スタイルに一般化可能な性能を実証すること。

提案手法

  • 10万枚の未ペアファッション画像を用いて、ポーズ条件付きジェネレータと衣類セグメンテーションブランチを統合した変更版StyleGAN2アーキテクチャを学習する。
  • 生成器の各レイヤーに対して最適化された係数を用いて、ターゲット人物と衣類画像の潜在空間を各レイヤーごとに補間する。
  • 顔貌・髪型の保持を目的としたアイデンティティ損失、編集を衣類領域に限定するためのロケーション損失、形状・色・テクスチャの転送を目的とした衣類損失を含むマルチコンponent損失関数によって最適化をガイドする。
  • 実写画像の試着では、入力画像をStyleGAN潜在空間に射影するステップを実施するが、生成画像の場合はこのステップをスキップする。
  • 最適化中に生成画像をセグメンテーションすることで、外部のセグメンテーションモデルを必要とせず、正確な領域別編集を可能にする。
  • 生成器を2次元人体ポーズで明示的に条件づけることで、合成時にターゲット人物のポーズを制御可能にし、ポーズ間の試着を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ペア学習データを一切不要とすることで、顔貌、肌色、ボディーシェイプを保持しつつ、高精細な仮想試着をGANベースの手法が達成できるか?
  • RQ2各レイヤー補間と比較して、グリーディーサーチ法や固定パラメータ法は、衣類の詳細や顔貌特徴の保持においてどのように差がつくか?
  • RQ3この手法は、衣類画像から複雑なテクスチャーや幾何的パターンをターゲット人物にどの程度正確に転送できるか?
  • RQ4ポーズ条件付き生成が、さまざまなボディーポーズにおける試着結果の品質と制御性をどのように向上させるか?
  • RQ5損失関数の各コンponent(アイデンティティ、ロケーション、衣類)が最終的な合成品質と意味的整合性に与える影響はどの程度か?

主な発見

  • TryOnGANは、512×512の実写および生成画像において、最先端の性能を達成し、写真のリアルさ、ボディーシェイプの忠実度、肌色の保持において、従来手法を上回った。
  • 各レイヤー最適化アプローチは、スリーブ長やテクスチャーパattersの転送において、グリーディーサーチ法と比較して顕著に性能が向上しており、定性的な比較で裏付けられた。
  • 生成画像では、幾何的パターンや複雑なテクスチャなどの高周波数ディテールを効果的に転送でき、最適化手法の潜在的限界を示した。
  • アブレーションスタディにより、アイデンティティ、ロケーション、衣類の3つの損失コンponentが、意味的整合性のある写真同等の結果を生成するために不可欠であることが確認された。
  • この手法は、肌や体の部位を一貫して合成でき、例えば長袖のターゲットにショートスリーブシャツを転送する際には腕の露出を適切に再現した。
  • 強力な結果を示したが、極端なポーズや未代表的な衣類では性能が低下し、実写画像の結果は現在の潜在空間射影の品質に制限を受けていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。