Skip to main content
QUICK REVIEW

[論文レビュー] Towards Hard-pose Virtual Try-on via 3D-aware Global Correspondence Learning

Zaiyu Huang, Hanhui Li|arXiv (Cornell University)|Nov 25, 2022
3D Shape Modeling and Analysis被引用数 7
ひとこと要約

本稿では、3D幾何的事前知識を暗黙的監視によって活用することで、グローバルな対応関係推定を向上させる、ハードポーズ仮想試着のための新規手法3D-aware Global Correspondence Learning(3D-GCL)を提案する。粗くから細かくまでのリファインメントと3D正則化損失を組み合わせることで、衣類のテクスチャを保持し、大きなポーズおよび視点変化に対しても優れた性能を達成し、ベンチマークおよびカスタムHardPoseデータセットの両方で、先行手法を上回る結果を示した。

ABSTRACT

In this paper, we target image-based person-to-person virtual try-on in the presence of diverse poses and large viewpoint variations. Existing methods are restricted in this setting as they estimate garment warping flows mainly based on 2D poses and appearance, which omits the geometric prior of the 3D human body shape. Moreover, current garment warping methods are confined to localized regions, which makes them ineffective in capturing long-range dependencies and results in inferior flows with artifacts. To tackle these issues, we present 3D-aware global correspondences, which are reliable flows that jointly encode global semantic correlations, local deformations, and geometric priors of 3D human bodies. Particularly, given an image pair depicting the source and target person, (a) we first obtain their pose-aware and high-level representations via two encoders, and introduce a coarse-to-fine decoder with multiple refinement modules to predict the pixel-wise global correspondence. (b) 3D parametric human models inferred from images are incorporated as priors to regularize the correspondence refinement process so that our flows can be 3D-aware and better handle variations of pose and viewpoint. (c) Finally, an adversarial generator takes the garment warped by the 3D-aware flow, and the image of the target person as inputs, to synthesize the photo-realistic try-on result. Extensive experiments on public benchmarks and our HardPose test set demonstrate the superiority of our method against the SOTA try-on approaches.

研究の動機と目的

  • 大きなポーズおよび視点変化に対処する際の、既存の仮想試着手法の限界を解消すること。
  • 2Dベースのフロー推定における3D幾何的ガイドランスの欠如により生じるテクスチャの歪みやアーティファクトを克服すること。
  • ローカルなフローマッピングに代えてグローバル対応関係学習を導入することで、衣類のワープにおける長距離依存性モデリングを改善すること。
  • 明示的な3Dメッシュ予測を避けることで、不正確な3Dメッシュ予測に起因するノイズを低減し、3D人体の事前知識を対応関係学習に暗黙的に統合すること。
  • 多様なポーズと視点を持つ挑戦的な人物間シナリオにおいて、写真のようにリアルな試着結果を達成すること。

提案手法

  • 2つの並列エンコーダが、ソース画像およびターゲット画像からポーズに依存する特徴および高レベル特徴表現を抽出する。
  • 複数のリファインメントモジュールを備えた粗くから細かくまでのデコーダが、特徴マップ間のクロスアテンションを計算することで、フル解像度のグローバル対応関係を予測する。
  • ジオメトリに注意を払った対応関係リファインメントモジュール(GACRMs)が、段階的にアップサンプリングおよびリファインメントを段階的に実行する。
  • 新規に導入された3D正則化損失は、SMPLベースのフローを用いて、リファインメントプロセスを暗黙的にガイドし、幾何的整合性を強制する。
  • 最終的なワープされた衣類は、ターゲット人物画像とともに adversarial generator に供給され、写真のようにリアルな試着結果が合成される。
  • 明示的な3Dメッシュ予測を避けることで、3D事前知識を暗黙的監視として活用し、ノイズを低減し、より頑健な性能を実現する。

実験結果

リサーチクエスチョン

  • RQ1大きなポーズ変化下でも、グローバル対応関係学習は、衣類ワープにおける長距離変形を効果的にモデル化できるか?
  • RQ2明示的な3Dメッシュ再構築に依存せずに、3D幾何的事前知識を対応関係学習に効果的に統合できるか?
  • RQ3SMPLフローによる暗黙的3D監視は、制約のない仮想試着シナリオにおけるフローマッピング推定の正確性と頑健性を向上させるか?
  • RQ4提示された3D正則化損失は、外観のみのフローマッピング推定と比較して、アーティファクトをどれほど低減し、テクスチャ保持をどれほど向上させるか?
  • RQ5本手法は、ポーズおよび視点の複雑さが異なる多様なデータセットに、どの程度一般化するか?

主な発見

  • 提案手法の3D-GCLは、DeepFashionデータセットで74.22という最高のmIoUスコアを達成し、衣類ワープにおける優れた意味的正確性を示した。
  • 本手法は10.58という最低のFIDスコアを達成し、高精細で写真のようにリアルな試着結果を示した。
  • カスタムHardPoseテストセットでは、2番目に優れた手法(Pose-with-Style)を著しく上回り、複雑なシナリオにおける強力な一般化性能を示した。
  • アブレーションスタディにより、グローバル対応関係推定と3D正則化損失の両方が不可欠であることが確認され、後者がmIoU向上に最も寄与した。
  • 人間評価では、視覚的品質に関して最も高い割合の肯定的評価が得られ、テクスチャおよび構造の保持において知覚的な優位性が確認された。
  • グローバル対応関係と3D正則化の両方を備えた完全なモデルが、すべての指標で最高の性能を達成し、長距離モデリングと幾何的ガイドランスの相乗効果を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。