[論文レビュー] End-to-End Learning of Geometric Deformations of Feature Maps for Virtual Try-On
本稿では、衣類の特徴マップをターゲット人物に合わせて変形させる学習可能な畳み込み幾何マッチャーを備えたエンドツーエンドのシamese U-Netアーキテクチャ、WUTONを提案する。このアーキテクチャにより、写真のようにリアルなバーチャルトライアルが可能になる。幾何マッチャー経由で顔認識損失および対抗的損失を逆伝播させることで、ストライプのような複雑なパターンを保持し、LPIPSおよび視覚的品質メトリクスにおいて最先端の性能を達成する。
The 2D virtual try-on task has recently attracted a lot of interest from the research community, for its direct potential applications in online shopping as well as for its inherent and non-addressed scientific challenges. This task requires to fit an in-shop cloth image on the image of a person. It is highly challenging because it requires to warp the cloth on the target person while preserving its patterns and characteristics, and to compose the item with the person in a realistic manner. Current state-of-the-art models generate images with visible artifacts, due either to a pixel-level composition step or to the geometric transformation. In this paper, we propose WUTON: a Warping U-net for a Virtual Try-On system. It is a siamese U-net generator whose skip connections are geometrically transformed by a convolutional geometric matcher. The whole architecture is trained end-to-end with a multi-task loss including an adversarial one. This enables our network to generate and use realistic spatial transformations of the cloth to synthesize images of high visual quality. The proposed architecture can be trained end-to-end and allows us to advance towards a detail-preserving and photo-realistic 2D virtual try-on system. Our method outperforms the current state-of-the-art with visual results as well as with the Learned Perceptual Image Similarity (LPIPS) metric.
研究の動機と目的
- 2Dバーチャルトライアルシステムにおける柄付き衣料のリアルな幾何的変形を生成する課題に対処すること。
- 従来の手法におけるピクセルレベルの合成と最適でないワープによるアーティファクトを克服すること。
- ワープと生成を統合した一貫性のあるエンドツーエンドフレームワークにより、別個の画像合成ステップの必要性を排除すること。
- 最終合成画像からの損失を用いて幾何マッチャーをエンドツーエンドで訓練することで、視覚的忠実度と知覚的類似性を向上させること。
- 推論時における低品質な人体パーサーに対しても頑健性を示しながら、高品質な出力を維持すること。
提案手法
- アグノスティック・ペルソン表現と衣類画像の両方を並列に処理するシアンセスU-Netジェネレータを提案する。
- 薄板スプラインのパラメータを介して空間変換を学習する畳み込み幾何マッチャーを導入する。
- エンコーダーとデコーダー層の間にスキップ接続を適用し、特徴量がマッチャーによって幾何的に変換された後、結合される。
- L1、知覚的(VGGベース)、および非ペaired対抗的損失を組み合わせたマルチタスク損失を用いて、ネットワーク全体をエンドツーエンドで訓練する。
- 最終的な画像再構成損失(L1、知覚的、対抗的)を幾何マッチャーに逆伝播させることで、構造を保持する変形を学習可能にする。
- 訓練中は事前学習済みの人体パーサーを用いてアグノスティック・ペルソン表現(ap)を生成し、衣類をマスクしながらもアイデンティティとポーズを保持する。
実験結果
リサーチクエスチョン
- RQ1幾何マッチャーのエンドツーエンド訓練が、バーチャルトライアルにおけるワープされた衣類の柄のリアルさを向上させるか?
- RQ2別個の画像合成ステップを排除することで、視覚的品質が向上し、より自然な影やコントラストが得られるか?
- RQ3知覚的および対抗的損失のエンドツーエンド逆伝播が、ストライプのような複雑なパターンの保持にどのように影響するか?
- RQ4推論時における人体パーサーの品質が劣化した場合、モデルはどの程度頑健であるか?
- RQ5LPIPSおよび視覚的忠実度メトリクスにおいて、本手法は最先端のアプローチと定量的・定性的にどのように比較されるか?
主な発見
- WUTONはペアドテストセットでLPIPSスコア0.101 ± 0.047を達成し、CP-VTON(0.131 ± 0.058)および元のアグノスティック表現を用いたCP-VTON(0.182 ± 0.049)を顕著に上回った。
- ペアドでない対抗的損失がペアド対抗的損失よりも優れた視覚的結果をもたらし、特にソースとターゲット衣類の形状差が大きい場合に有効であった。
- 対抗的損失を除去するとLPIPSスコアは0.107 ± 0.049に上昇し、対抗的訓練が知覚的リアリズムとコントラストを向上させることを示した。
- 画像レベル損失を幾何マッチャーに逆伝播しないようにするとLPIPSスコアは0.112 ± 0.053に上昇し、構造の保持のためにはエンドツーエンド訓練が不可欠であることを証明した。
- エンドツーエンドアーキテクチャを二段階プロセス(粗い生成+合成)に置き換えると性能が劣化し、LPIPSは0.105 ± 0.047に上昇した。
- 推論時、人体パーサーをグレーゾーンボックスに置き換えてもモデルは強力な性能を維持しており、パーサーの誤りに対して耐性があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。