Skip to main content
QUICK REVIEW

[論文レビュー] M2E-Try On Net: Fashion from Model to Everyone

Zhonghua Wu, Guosheng Lin|arXiv (Cornell University)|Nov 21, 2018
Generative Adversarial Networks and Image Synthesis参考文献 30被引用数 21
ひとこと要約

M2E-Try On Net (M2E-TON) は、綺麗な製品画像を必要とせずに、モデル画像からユーザーの写真へ衣類を転送することで、写真のようにリアルなバーチャルトライオンを実現する。自己教師あり、非ペaired・ペアドの共同学習方式を採用し、ポーズアライメントネットワーク(PAN)、テクスチャリファインメントネットワーク(TRN)、フィッティングネットワーク(FTN)の3つのコンponentで構成され、ポーズの整合、テクスチャの強化、衣類の滑らかなフィットを実現し、ユーザー評価で83.7%の好まれる割合を達成し、最先端のリアルさを実現した。

ABSTRACT

Most existing virtual try-on applications require clean clothes images. Instead, we present a novel virtual Try-On network, M2E-Try On Net, which transfers the clothes from a model image to a person image without the need of any clean product images. To obtain a realistic image of person wearing the desired model clothes, we aim to solve the following challenges: 1) non-rigid nature of clothes - we need to align poses between the model and the user; 2) richness in textures of fashion items - preserving the fine details and characteristics of the clothes is critical for photo-realistic transfer; 3) variation of identity appearances - it is required to fit the desired model clothes to the person identity seamlessly. To tackle these challenges, we introduce three key components, including the pose alignment network (PAN), the texture refinement network (TRN) and the fitting network (FTN). Since it is unlikely to gather image pairs of input person image and desired output image (i.e. person wearing the desired clothes), our framework is trained in a self-supervised manner to gradually transfer the poses and textures of the model's clothes to the desired appearance. In the experiments, we verify on the Deep Fashion dataset and MVC dataset that our method can generate photo-realistic images for the person to try-on the model clothes. Furthermore, we explore the model capability for different fashion items, including both upper and lower garments.

研究の動機と目的

  • 綺麗な製品画像を必要とせず、モデル画像とユーザー画像のみを用いてバーチャルトライオンを実現すること。
  • 非剛体な衣類の変形、テクスチャの保持、アイデンティティの外見の一貫性といった課題に対処すること。
  • ペアドデータと非ペアドデータを活用する自己教師あり学習フレームワークを構築し、リアルさを向上させること。
  • 細部や衣類の特徴を保持した写真のようにリアルなトライオン結果を生成すること。
  • 3Dデータやペアドアノテーションを必要とせず、eコマースやソーシャルメディアにおける実用的応用を可能にすること。

提案手法

  • ポーズアライメントネットワーク(PAN)は、密度のあるポーズ推定と幾何的ワープを用いて、モデルのポーズをターゲット人物のポーズに一致させる。
  • テクスチャリファインメントネットワーク(TRN)は、ポーズに依存するGANを用いて、ワープされたモデル画像の細部、ロゴ、テクスチャを強化する。
  • フィッティングネットワーク(FTN)は、アイデンティティとボディーシェイプを保持しながら、洗練された衣類をターゲット人物の画像に滑らかに融合させる。
  • 非ペアドとペアドのデータを組み合わせた、新しい非ペアド・ペアド共同学習戦略を採用。同じ人物が異なるポーズで撮影されたペアド画像を自己教師あり学習で、非ペアドデータを無教師学習で活用する。
  • ポーズに依存するGANのディスクライマーは、生成画像とターゲットポーズの不整合をペナルティ化することで、ポーズの一貫性を強制する。
  • フレームワークは、クリーニングされた製品画像を一切必要とせず、モデル画像とターゲット人物画像のみを入力として、エンドツーエンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1モデル画像から直接衣類を転送することで、綺麗な製品画像を必要とせずにバーチャルトライオンを実現できるか?
  • RQ2衣類転送中にモデルとユーザーの間でポーズが不一致になる問題を効果的に解決できるか?
  • RQ3ロゴやパターンのようなテクスチャの細部が、非剛体な衣類変形の過程でも保持できるか?
  • RQ4ペアドデータが限られる状況で、ペアド画像に対する自己教師あり学習が性能をどのように向上させるか?
  • RQ5特に複雑な衣類のパターンに対して、この手法の失敗モードは何か?

主な発見

  • 提案された M2E-TON は、人間評価で 83.7% のユーザー好まれ率を達成し、VITON(8.5%) や CP-VTON(7.0%) といったベースラインを著しく上回った。
  • PAN に組み込まれたポーズに依存する GAN は、標準的なパッチ GAN よりもポーズの不整合アーチファクトを効果的に低減した。
  • TRN はテクスチャの忠実度を顕著に向上させ、ワープ後でもロゴや細かいパターンを保持した。
  • Deep Fashion および MVC データセットを用いた検証により、上衣および下着を含む多様なファッションアイテムにおいても良好な性能を示した。
  • 失敗事例としては、モデルの衣類に頭の模様がある場合、ネットワークがそれを人間の頭と誤認識する傾向がある。
  • 非ペアド・ペアド共同学習戦略により、高価なペアドトレーニングデータを必要とせず、高いリアルさを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。