Skip to main content
QUICK REVIEW

[論文レビュー] Dress Code: High-Resolution Multi-Category Virtual Try-On

Davide Morelli, Matteo Fincato|arXiv (Cornell University)|Apr 18, 2022
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本論文は、上半身、下半身、全身の衣類を含む複数カテゴリの衣類と全身のモデルをペアで持つ、大規模で高解像度(1024×768)のデータセット「Dress Code」を紹介する。視覚的忠実度を向上させるために、画素レベルでの意味的整合性を強制するピクセルレベル意味認識ディスクライマナ(PSAD)を提案し、仮想試着の結果におけるリアリズムと詳細さを著しく向上させ、定量的およびユーザースタディーの両面で、VITONベンチマークと同様にDress Codeベンチマークでも最先端の手法を上回った。

ABSTRACT

Image-based virtual try-on strives to transfer the appearance of a clothing item onto the image of a target person. Prior work focuses mainly on upper-body clothes (e.g. t-shirts, shirts, and tops) and neglects full-body or lower-body items. This shortcoming arises from a main factor: current publicly available datasets for image-based virtual try-on do not account for this variety, thus limiting progress in the field. To address this deficiency, we introduce Dress Code, which contains images of multi-category clothes. Dress Code is more than 3x larger than publicly available datasets for image-based virtual try-on and features high-resolution paired images (1024x768) with front-view, full-body reference models. To generate HD try-on images with high visual quality and rich in details, we propose to learn fine-grained discriminating features. Specifically, we leverage a semantic-aware discriminator that makes predictions at pixel-level instead of image- or patch-level. Extensive experimental evaluation demonstrates that the proposed approach surpasses the baselines and state-of-the-art competitors in terms of visual quality and quantitative results. The Dress Code dataset is publicly available at https://github.com/aimagelab/dress-code.

研究の動機と目的

  • 画像ベースの仮想試着の分野において、特に下半身および全身の衣類を対象とした多様で高解像度のデータセットが不足しているという問題に対処すること。
  • 身体部位に特化した衣類のアライメントを学習することで、複数の衣類カテゴリを処理できる仮想試着フレームワークの開発。
  • 細分化された意味的スーパービジョンを通じて、生成された試着画像の視覚的品質とリアリズムの向上。
  • 多様な衣類カテゴリを備えた新しい公開データセットを用いて、仮想試着のための包括的なベンチマークの確立。

提案手法

  • 50,000枚を超える高解像度(1024×768)のモデルが複数カテゴリの衣類を着用したペア画像を含む、新しい公開データセット「Dress Code」を提案。
  • 画素単位での意味的セグメンテーションと本物/生成画像の分類を実行するピクセルレベル意味認識ディスクライマ(PSAD)を導入し、リアリズムを向上。
  • 意味的ヒントに基づいて衣類を正しい身体領域にアライメントする、粗くから細かくまでの画像合成ネットワークを訓練。
  • パーサーを用いたディスクライマを用いて、内部の意味的表現を学習し、生成画像におけるテクスチャーや形状の整合性を向上。
  • 敵対的損失、知覚的損失、L1損失を組み合わせたマルチステージ訓練パイプラインを採用し、アイデンティティと衣類の詳細を保持。
  • 新しいDress Codeデータセットおよび標準のVITONベンチマークの両方で手法を検証し、アブレーションスタディおよびユーザースタディを実施。

実験結果

リサーチクエスチョン

  • RQ1高解像度で複数カテゴリの仮想試着データセットは、画像合成モデルの一般化性能とリアリズムを向上させることができるか?
  • RQ2ピクセルレベルの意味認識ディスクライマは、パッチレベルまたは画像レベルのディスクライマと比較して、高精細な試着画像生成においてどのように優れているか?
  • RQ3統一されたアーキテクチャは、上半身、下半身、全身の多様な衣類カテゴリを、一貫した身体アライメントで効果的に処理できるか?
  • RQ4提案手法は、定量的指標および人間評価の両面で、最先端のモデルをどの程度上回るか?

主な発見

  • PSADモデルはVITONデータセット上でFID 13.71、KID 0.412を達成し、パッチベースライン(FID: 14.76、KID: 0.495)およびCP-VTON+やACGPNといった最先端手法を上回った。
  • Dress Codeデータセットでは、PSADは全解像度でパッチベースラインと比較してFIDを5.00ポイント、KIDを0.46ポイント改善した。
  • ユーザースタディーでは、PSADモデルが62.3%の比較でよりリアリストイックであると選ばれ、64.1%のケースで入力の衣類およびモデルとより整合性があると評価された。
  • VITON上でのSSIMはPSADが0.885を達成し、CP-VTON+(0.828)およびACGPN(0.845)を上回り、構造的保持の優位性を示した。
  • 本手法は解像度にかかわらず良好な一般化性能を示し、256×192から1024×768の範囲で一貫した性能向上を示した。
  • 上半身と下半身の衣類を逐次適用するフルマルチガーメント試着設定が、Dress Code上で成功裏に実装された。これはVITONでは実現不可能な能力である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。