Skip to main content
QUICK REVIEW

[論文レビュー] High-Resolution Virtual Try-On with Misalignment and Occlusion-Handled Conditions

Sangyun Lee, Gyojung Gu|arXiv (Cornell University)|Jun 28, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、衣類の変形とセグメンテーションマップ生成を統合的に実行する統一されたトライオンコンditionジェネレータを提案する。これにより、ずれのない、オクルージョンに配慮した高解像度バーチャルトライアルが可能になる。変形モジュールとセグメンテーションモジュール間の特徴量の融合とディスクライマーリジェクトを導入することで、ピクセル圧縮アーティファクトが解消され、1024×768解像度のベンチマークで最先端の性能を達成する。

ABSTRACT

Image-based virtual try-on aims to synthesize an image of a person wearing a given clothing item. To solve the task, the existing methods warp the clothing item to fit the person's body and generate the segmentation map of the person wearing the item before fusing the item with the person. However, when the warping and the segmentation generation stages operate individually without information exchange, the misalignment between the warped clothes and the segmentation map occurs, which leads to the artifacts in the final image. The information disconnection also causes excessive warping near the clothing regions occluded by the body parts, so-called pixel-squeezing artifacts. To settle the issues, we propose a novel try-on condition generator as a unified module of the two stages (i.e., warping and segmentation generation stages). A newly proposed feature fusion block in the condition generator implements the information exchange, and the condition generator does not create any misalignment or pixel-squeezing artifacts. We also introduce discriminator rejection that filters out the incorrect segmentation map predictions and assures the performance of virtual try-on frameworks. Experiments on a high-resolution dataset demonstrate that our model successfully handles the misalignment and occlusion, and significantly outperforms the baselines. Code is available at https://github.com/sangyun884/HR-VITON.

研究の動機と目的

  • 高解像度バーチャルトライアルにおける変形衣類とセグメンテーションマップのずれを解消する。
  • 身体部位による衣類のオクルージョンによって引き起こされるピクセル圧縮アーティファクトを軽減する。
  • 高解像度(1024×768)バーチャルトライアルデータセットにおける性能を向上させる。
  • ディスクライマーリジェクトによる誤ったセグメンテーション予測のフィルタリングにより、実世界応用における適用性を高める。

提案手法

  • 変形とセグメンテーションマップの両方を同時に予測する統一されたトライオンコンディションジェネレータを導入し、内在的な整合性を保証する。
  • 変形モジュールとセグメンテーションモジュール間の双方向的情報交換を可能にするための特徴量融合ブロックを設計する。
  • コンディションアライニングを適用し、変形衣類と予測されたセグメンテーションマップの間の空間的一致性を強制する。
  • 低品質または誤ったセグメンテーションマップ予測をフィルタリングするため、ディスクライマーリジェクトを実装する。
  • 最終画像の忠実度を向上させるために、セグメンテーションマップの品質を評価するディスクライマーを備えたGANベースのフレームワークを採用する。
  • ペアドされた人物と衣類の画像で構成される高解像度バーチャルトライアルデータセットを用いて、モデルをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1変形とセグメンテーション生成を統合的に実行するアーキテクチャは、高解像度バーチャルトライアルにおけるずれアーティファクトを完全に解消できるか?
  • RQ2特に複雑なジオメトリを示す領域において、本手法は身体部位による衣類のオクルージョンに対し、どの程度効果的に対処できるか?
  • RQ3変形モジュールとセグメンテーションモジュール間の特徴量融合は、視覚的品質の向上とアーティファクトの低減にどの程度寄与するか?
  • RQ4ディスクライマーリジェクトは、実世界のバーチャルトライアル応用における分布外入力に対するロバストネスを向上させることができるか?

主な発見

  • 提案手法は、1024×768解像度のバーチャルトライアルベンチマークで最先端の性能を達成し、VITON-HDや他の最先端ベースラインを上回った。
  • 定量的評価では、ペアドでない設定においてKIDスコアが0.179、FIDが10.91と、PF-AFNや他のパーサーフリー手法よりも顕著に優れた結果を示した。
  • アブレーションスタディにより、特徴量融合ブロックとコンディションアライニングの両方が不可欠であることが確認され、両方を適用した際にはFIDが15%改善された。
  • 定性的な結果から、ずれやピクセル圧縮アーティファクトが完全に解消されていることが明らかになり、特にオクルージョン領域で顕著であった。
  • ディスクライマーリジェクトは誤ったセグメンテーション予測を効果的にフィルタリングし、実世界のシナリオにおけるロバストネスを向上させた。
  • CP-VTONやACGPNは高解像度ペアドでない設定で一般化に失敗するが、本モデルはそれらを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。