Skip to main content
QUICK REVIEW

[論文レビュー] Reference-guided Face Component Editing

Qiyao Deng, Jie Cao|arXiv (Cornell University)|Jun 3, 2020
Generative Adversarial Networks and Image Synthesis参考文献 26被引用数 5
ひとこと要約

本稿では、一対でない参照画像を用いて、高レベルの顔面部品(例:目、鼻、口)の多様で制御可能かつ幾何学的に正確な編集を可能にする、リファレンスガイドド型顔面部品編集フレームワーク r-FACE を提案する。画像補填バックボーンと例示ガイドドアテンションモジュールを活用し、ターゲット部品に注目することで、マニュアルマスクやスケッチの必要を排除し、顔面編集の品質と形状の一貫性において最先端の結果を達成する。

ABSTRACT

Face portrait editing has achieved great progress in recent years. However, previous methods either 1) operate on pre-defined face attributes, lacking the flexibility of controlling shapes of high-level semantic facial components (e.g., eyes, nose, mouth), or 2) take manually edited mask or sketch as an intermediate representation for observable changes, but such additional input usually requires extra efforts to obtain. To break the limitations (e.g. shape, mask or sketch) of the existing methods, we propose a novel framework termed r-FACE (Reference-guided FAce Component Editing) for diverse and controllable face component editing with geometric changes. Specifically, r-FACE takes an image inpainting model as the backbone, utilizing reference images as conditions for controlling the shape of face components. In order to encourage the framework to concentrate on the target face components, an example-guided attention module is designed to fuse attention features and the target face component features extracted from the reference image. Through extensive experimental validation and comparisons, we verify the effectiveness of the proposed framework.

研究の動機と目的

  • 既存の顔面編集手法が事前に定義された属性や手作業によるマスクやスケッチに依存するという制限を解消すること。
  • 目、鼻、口などの高レベルの顔面部品に対して柔軟で形状制御可能な編集を可能にすること。
  • 一対でない参照画像を形状ガイドとして用いることで、正確な中間表現(例:マスク、スケッチ)の必要性を排除すること。
  • 部品移動中にアイデンティティの一貫性、ポーズ、肌色、トポロジカル構造を維持すること。
  • データ拡張やフェイススワッピングを含む多様な編集応用をサポートするフレームワークの開発

提案手法

  • フレームワークは、ソース画像(一部破損済み)とマスクを入力とする画像補填モデルをバックボーンとして使用する。
  • 参照画像が形状条件として用いられ、その特徴量は専用の埋め込みネットワーク $\mathcal{E}_r$ を通じてエンコードされる。
  • 例示ガイドドアテンションモジュールが、補填ネットワークと参照画像の特徴量を融合し、特にターゲット顔面部品に注目する。
  • モデルは3つの損失関数で訓練される:コンテキスト損失(形状類似性を制約)、スタイル損失(肌色を維持)、および知覚損失(構造的一致性を維持)。
  • アテンションモジュールは、参照画像からの関連する顔面部品領域にのみ注目することで、特徴量の整合性を向上させる。
  • ペアド画像を必要とせず、異なるアイデンティティの任意の参照画像を用いて編集が可能である。

実験結果

リサーチクエスチョン

  • RQ1正確なマスクやスケッチを中間ガイドとして必要とせずに、顔面部品の編集が可能になるか?
  • RQ2ディープラーニングモデルは、参照画像からソース画像への顔面部品の幾何学的形状を効果的に転送できるか?
  • RQ3アテンションメカニズムは、画像生成中に特定の顔面部品に注目するのをどの程度向上させられるか?
  • RQ4顔面部品に大きな幾何的変更を加えながらもアイデンティティの一貫性を保つために、どの損失関数が最も効果的か?
  • RQ5ポーズや表情が異なるアイデンティティ間で、フレームワークは一般化可能か?

主な発見

  • 提案された r-FACE フレームワークは、CelebA-HQ データセットで最先端の性能を達成し、Fréchet Inception Distance (FID) が 8.49、MS-SSIM が 0.89 を記録した。
  • アブレーションスタディにより、例示ガイドドアテンションモジュールが性能向上に顕著に寄与することが確認され、それなしのベースラインに比べて FID および MS-SSIM で優れた結果を示した。
  • コンテキスト損失を除去すると最も悪い性能が得られ、これは参照画像との形状的一致性を強制する上で不可欠な役割を果たしていることを示している。
  • スタイル損失と知覚損失は、肌色と構造的詳細の維持に不可欠であり、それらを欠如させると色の歪みやゴーストアーチファクトが生じた。
  • 可視的比較により、r-FACE は参照画像からの複雑な形状(例:目や鼻の輪郭)を的確に転送しながらも、現実的でアイデンティティの一貫性を保った外観を実現した。
  • 単に参照画像を変更するだけで多様な編集結果が得られることから、ペアドデータや手作業のアノテーションを必要とせず、高い制御性と柔軟性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。