[論文レビュー] Style-Based Global Appearance Flow for Virtual Try-On
本論文では、バーチャルトライオンのためのStyleGANベースのグローバルな外観フロー推定モデルを提案する。グローバルなスタイルベクトルを用いることで、長距離の文脈を捉え、大規模な不一致や複雑なポーズに対しても耐性を高める。グローバルなスタイルモodulationとローカルなフローリファインメントを組み合わせることで、VITONベンチマークで最先端の性能を達成し、SSIMが0.91、FIDが8.89を達成した。
Image-based virtual try-on aims to fit an in-shop garment into a clothed person image. To achieve this, a key step is garment warping which spatially aligns the target garment with the corresponding body parts in the person image. Prior methods typically adopt a local appearance flow estimation model. They are thus intrinsically susceptible to difficult body poses/occlusions and large mis-alignments between person and garment images (see Fig.~ ef{fig:fig1}). To overcome this limitation, a novel global appearance flow estimation model is proposed in this work. For the first time, a StyleGAN based architecture is adopted for appearance flow estimation. This enables us to take advantage of a global style vector to encode a whole-image context to cope with the aforementioned challenges. To guide the StyleGAN flow generator to pay more attention to local garment deformation, a flow refinement module is introduced to add local context. Experiment results on a popular virtual try-on benchmark show that our method achieves new state-of-the-art performance. It is particularly effective in a `in-the-wild' application scenario where the reference image is full-body resulting in a large mis-alignment with the garment image (Fig.~ ef{fig:fig1} Top). Code is available at: \url{https://github.com/SenHe/Flow-Style-VTON}.
研究の動機と目的
- バーチャルトライオンにおけるローカルな外観フロー推定の限界、特に大規模な不一致や複雑なポーズ下での限界を解消すること。
- ローカル特徴対応に依存する既存のフローベース手法に欠けるグローバルな文脈を克服すること。
- 全身の人物画像が使用される「リアルワールド」のシナリオにおいても、耐性のある衣類ワープを可能にすること。
- ローカルなリファインメントとグローバルなスタイルモジュレーションを統合し、グローバルな文脈と詳細な変形モデリングのバランスを取ること。
- 推論時に人間のパースリングを必要としないVITONベンチマークで最先端の性能を達成すること。
提案手法
- スタイルGANアーキテクチャに基づく、全画像の文脈を符号化するグローバルスタイルベクトルを用いた、新規な外観フロー推定モジュールを提案する。
- 各ワーピングブロックでスタイルモジュレーション(SM)を用い、人物と衣類の画像特徴を連結したものを入力として、グローバルな外観フローを生成する。
- ローカル対応に基づくフローを推定するローカルフローリファインメント(RF)モジュールを導入し、詳細な変形モデリングを強化する。
- グローバルフローチェック(SM)とローカルリファインメント(RF)をスタックドワーピングブロック構造で統合し、精度を向上させる。
- 現実的なトライオン結果を保証するため、知覚的損失と敵対的損失を用いてモデルをエンドツーエンドで訓練する。
- マルチスケール特徴抽出戦略を活用し、低解像度の特徴マップから得られるグローバルスタイルベクトルを、高解像度のフローパラメータ予測をガイドする。

実験結果
リサーチクエスチョン
- RQ1スタイルGANベースのアーキテクチャにグローバルスタイルベクトルを導入することで、人物と衣類の画像間に大規模な不一致がある状況でも外観フロー推定が向上するか?
- RQ2複雑なポーズや隠蔽に対処する際、グローバルスタイルモジュレーションはローカル対応ベースのフロー推定と比較してどのように優れているか?
- RQ3グローバルスタイルモジュレーションとローカルフローリファインメントを組み合わせることで、単体の各モジュールよりも優れた性能が得られるか?
- RQ4提案手法は、全身のリファレンス画像と顕著な空間的不一致を伴う「リアルワールド」シナリオにも一般化可能か?
- RQ5グローバルフローが不十分な場合、ローカルリファインメントモジュールがローカル変形の正確性を向上させる貢献は何か?
主な発見
- 提案手法は、標準的なVITONベンチマークで、SSIMが0.91、FIDが8.89という、新たな最先端の成績を達成した。
- 人間評価では、次善の手法(AF-PFN)と比較して56.8%の割合で好まれ、明確な視覚的品質の優位性を示した。
- アブレーションスタディの結果、スタイルモジュレーション(SM)とローカルリファインメント(RF)の組み合わせが最良の性能(SSIM: 0.91、FID: 8.89)を達成し、SM単体(SSIM: 0.89、FID: 9.84)やRF単体(SSIM: 0.89、FID: 10.73)を上回った。
- 大規模な不一致に対して顕著に耐性がある:人物画像が垂直方向にずれた場合、他の手法は急激に性能が低下する一方、本手法は高い性能を維持した。
- 拡張されたVITONデータセットでは、性能低下が最小限(ΔSSIM: 0.00、ΔFID: 1.02)に抑えられ、優れた一般化性と耐性を示した。
- 可視化分析により、特にスリーブやカラー部など挑戦的な領域において、SMとRFを併用した場合に正確なローカルフローを予測できていることが確認された。
![Figure 3 : Qualitative results from different models (CP-VTON++ [ 26 ] , ACGPN [ 42 ] , PF-AFN [ 9 ] and ours) on VITON testing dataset.](https://ar5iv.labs.arxiv.org/html/2204.01046/assets/x3.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。