Skip to main content
QUICK REVIEW

[論文レビュー] Semi-parametric Makeup Transfer via Semantic-aware Correspondence

Mingrui Zhu, Yun Yi|arXiv (Cornell University)|Mar 4, 2022
Generative Adversarial Networks and Image Synthesis被引用数 6
ひとこと要約

本論文は、非パラメトリックなセマンティックアウェアコアポンデンス(SaC)とパラメトリックなデコーダーを組み合わせた半パラメトリックなメイク転送手法SpMTを提案する。SaCモジュールは、ソース画像とリファレンス画像間のセマンティックアウェアな特徴対応を確立し、ポーズ、表情、オクルージョンの変動に対しても顔のアイデンティティと構造を保持しながら、ロバストで柔軟かつ高品質なメイク転送を可能にする。

ABSTRACT

The large discrepancy between the source non-makeup image and the reference makeup image is one of the key challenges in makeup transfer. Conventional approaches for makeup transfer either learn disentangled representation or perform pixel-wise correspondence in a parametric way between two images. We argue that non-parametric techniques have a high potential for addressing the pose, expression, and occlusion discrepancies. To this end, this paper proposes a extbf{S}emi- extbf{p}arametric extbf{M}akeup extbf{T}ransfer (SpMT) method, which combines the reciprocal strengths of non-parametric and parametric mechanisms. The non-parametric component is a novel extbf{S}emantic- extbf{a}ware extbf{C}orrespondence (SaC) module that explicitly reconstructs content representation with makeup representation under the strong constraint of component semantics. The reconstructed representation is desired to preserve the spatial and identity information of the source image while "wearing" the makeup of the reference image. The output image is synthesized via a parametric decoder that draws on the reconstructed representation. Extensive experiments demonstrate the superiority of our method in terms of visual quality, robustness, and flexibility. Code and pre-trained model are available at \url{https://github.com/AnonymScholar/SpMT.

研究の動機と目的

  • 完全パラメトリックなメイク転送モデルの限界を解決する。具体的には、そばかすの処理が不十分で、素材の適用が現実的でない点を改善する。
  • 実世界のメイク転送シナリオにおけるポーズ、表情、オクルージョンの差異に起因する課題を克服する。
  • 非パラメトリック手法の長所(例:リファレンス画像からの直接的な素材再利用)を活かしながら、パラメトリックなデコーディングの効率性を維持する。
  • ハイブリッドなパラメトリック・非パラメトリックなフレームワークにより、制御可能でロバストなメイク転送を実現する。
  • 対応学習中にコンponentレベルのセマンティックを明示的にモデル化することで、視覚的品質とアイデンティティの保持を向上させる。

提案手法

  • 特徴ピラミッドの複数レベルでクロス画像特徴対応を確立する、新しいセマンティックアウェアコアポンデンス(SaC)モジュールを提案する。
  • SaCモジュールを用いて、リファレンス画像から非パラメトリックにメイク素材(例:口紅の色、ファンデーション)を抽出し、セマンティックコンポonentのアライメントに基づいてソース画像に転送する。
  • SaCモジュール内でコサイン類似度ベースのマッチング戦略を採用し、単なる空間的近接性ではなく、意味的意味に基づいた対応を保証する。
  • トレーニング中に、ソースと再構築された表現間のセマンティック整合性を強制するためのコスメティックペルセプチュアル損失を導入する。
  • 再構築された、メイクが追加されたコンテンツ表現をパラメトリックなデコーダーに供給し、最終的なメイク付き画像を生成する。
  • 生成の現実性と忠実度を保証するため、 adversarial loss、cycle-consistency loss、および提案されたコスメティックペルセプチュアル損失を用いてモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1完全パラメトリックモデルと比較して、非パラメトリック機構はポーズ、表情、オクルージョンの変動に対するロバスト性を向上させることができるか?
  • RQ2セマンティックアウェアコアポンデンスは、ピixeLワイズまたは非セマンティックな対応と比較して、メイク素材転送の現実性と正確性をどのように向上させるか?
  • RQ3ハイブリッドな半パラメトリック設計により、再トレーニングを必要とせずに、インタラクティブなメイク転送(例:補間、部分別転送)をどの程度可能にするか?
  • RQ4提案手法は、最先端のパラメトリック手法と比較して、ソース画像のアイデンティティと構造的詳細をよりよく保持するか?
  • RQ5環境的変動がある実世界の制約のない画像において、本手法は優れた視覚的品質と一般化性能を達成できるか?

主な発見

  • SpMTは、3つのメイクスタイル(西洋風:141.3、vFG:156.4、vHX:119.2)において、すべてで最小のFréchet Inception Distance(FID)スコアを達成し、リファレンスのメイク画像との分布的類似性が優れていることを示している。
  • 本手法はSSIMスコアが0.89を記録し、BeautyGAN(0.87)、PSGAN(0.80)、SCGAN(0.81)を大きく上回り、コンテンツおよびアイデンティティ保持の優位性を示している。
  • ユーザースタディーにおいて、SpMTはポーズ・表情・オクルージョンの変動がある挑戦的な画像を含め、両方の画像セットで最高の投票率(40%以上)を獲得した。
  • 本手法は、BeautyGAN や PSGAN でよく見られる「口紅が口の中に入ってしまう」などのアーティファクトを効果的に回避している。
  • 定性的な結果から、補間や再構築表現の部分別選択を可能にする柔軟で制御可能なメイク転送が、SpMTによって実現されている。
  • 1枚あたり約1秒(NVIDIA 3090 GPU 1台)の計算コストであるが、高い視覚的品質とロバスト性を維持しており、コードと事前学習済みモデルを公開している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。