Skip to main content
QUICK REVIEW

[論文レビュー] FEAT: Face Editing with Attention

Xianxu Hou, Linlin Shen|arXiv (Cornell University)|Feb 6, 2022
Face recognition and analysis被引用数 11
ひとこと要約

FEATは、StyleGANにおける顔の編集をテキストで制御する手法を提案する。学習されたアテンションマップを用いて編集箇所を顔の特定領域に局在化させることで、分離性と制御性を向上させる。CLIPによって監視されたアテンションマスクを用いて特徴量をブレンドすることで、元の潜在空間の分離性に依存せず、属性に特化した正確な操作を実現する。

ABSTRACT

Employing the latent space of pretrained generators has recently been shown to be an effective means for GAN-based face manipulation. The success of this approach heavily relies on the innate disentanglement of the latent space axes of the generator. However, face manipulation often intends to affect local regions only, while common generators do not tend to have the necessary spatial disentanglement. In this paper, we build on the StyleGAN generator, and present a method that explicitly encourages face manipulation to focus on the intended regions by incorporating learned attention maps. During the generation of the edited image, the attention map serves as a mask that guides a blending between the original features and the modified ones. The guidance for the latent space edits is achieved by employing CLIP, which has recently been shown to be effective for text-driven edits. We perform extensive experiments and show that our method can perform disentangled and controllable face manipulations based on text descriptions by attending to the relevant regions only. Both qualitative and quantitative experimental results demonstrate the superiority of our method for facial region editing over alternative methods.

研究の動機と目的

  • GANにおける分離的かつ局所的な顔編集の課題に対処し、編集が意図しない属性に誤って影響を与えるのを防ぐ。
  • StyleGANの潜在空間における固有の分離性に依存しないようにし、編集を対象となる顔の領域に明示的に局在化する。
  • CLIPのテキスト-画像埋め込みを活用して監視することで、ユーザーの介入を最小限に抑え、直感的なテキストベースの編集を実現する。
  • 空間的アテンションマップで特徴量のブレンドを誘導することで、編集の品質とアイデンティティの保持を向上させる。
  • さまざまな編集タスク(例:色 vs. 構造)に対して、異なる特徴量層にアテンションマップを適用する有効性を実証する。

提案手法

  • CLIPの埋め込みを監視として用い、テキストプロンプトに対応する潜在空間オフセットを予測するマッパーネットワークを学習する。
  • 編集を適用する場所をガイドする空間マスクを生成するアテンションモジュールを導入する。
  • 選択されたStyleGAN生成器の中間層で、元の特徴量と変更済み特徴量をアテンションマスクを用いてブレンドする。
  • CLIPのテキスト-画像埋め込み空間を活用して、テキストプロンプトと関連する顔領域を一致させ、ゼロショットでテキスト駆動の編集を可能にする。
  • アテンションマスクを用いて元の特徴量と編集済み特徴量のブレンドを実行し、アイデンティティの保持を促進し、漏れ出しが生じるのを低減する。
  • まず領域マスク(例:「黒髪」)を学習し、その後にその領域内でのみ2番目の編集(例:「炎」の色)を適用することで、2段階編集を可能にする。

実験結果

リサーチクエスチョン

  • RQ1CLIPの埋め込みから学習されたアテンションマップは、GANベースの顔編集において、編集を特定の顔領域に効果的に局在化できるか?
  • RQ2アテンションガイドドの特徴量ブレンドは、標準的な潜在空間編集手法と比較して、分離性を向上させるか?
  • RQ3ブレンドに使用する特徴量層の選択が、編集の品質と特異性(例:色の変更 vs. 構造的変更)に与える影響は何か?
  • RQ4アテンション機構により、編集強度や分離パラメータの手動チューニングを必要とせずに、より直感的なテキストベースの編集が可能になるか?
  • RQ52段階プロセスにおいて、アテンションマスクを再利用することで、高精度な領域特化型編集が可能になるか?

主な発見

  • アテンションガイドド手法は、バックグラウンドや関係のない顔の特徴など、非対象属性への不要な変更を、ベースライン手法と比較して顕著に低減する。
  • 実験の結果、色の操作には高層層(例:レイヤー18)でのブレンドがより優れた結果をもたらすのに対し、表情や形状の変更には低層層(例:レイヤー8)でのブレンドがより効果的であることが示された。
  • アブレーションスタディにより、アテンションマップを除去すると編集が混合してしまうことが確認された(例:目を変えると肌の色や背景まで影響する、顔の形状を変更すると髪や眼鏡に影響が出る)。
  • 2段階編集アプローチにより、事前に定義された領域内での複雑な編集(例:「炎」や「ラベンダー」の色に髪を染める)が正確に局在化され、明確な領域制御が可能であることが示された。
  • 定量的評価では、FID(画像品質)が低く、CS(アイデンティティ保持)が高く、ED(編集距離)が低いという結果が得られ、優れた視覚的忠実性と編集の特異性が確認された。
  • 本手法は多様な顔の属性やポーズに一般化可能であり、さまざまな条件下でもアテンションマスクが関連する領域を効果的に特定していることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。