Skip to main content
QUICK REVIEW

[論文レビュー] AnyFace: Free-style Text-to-Face Synthesis and Manipulation

Jianxin Sun, Qiyao Deng|arXiv (Cornell University)|Mar 29, 2022
Face recognition and analysis被引用数 5
ひとこと要約

AnyFace は、最初の自由形式テキストから顔を生成・操作するフレームワークを提案する。CLIPベースの特徴一致と独創的な多様なトリプレット損失を備えた二ストリームアーキテクチャを用い、任意のテキスト記述から高品質で多様性に富んだ顔の生成を可能にする。Multi-modal CelebA-HQ および CelebAText-HQ で最先端の結果を達成し、キャプション数、内容、形式に制限のないオープンワールド、マルチキャプション、連続的なテキスト誘導型顔の操作をサポートする。

ABSTRACT

Existing text-to-image synthesis methods generally are only applicable to words in the training dataset. However, human faces are so variable to be described with limited words. So this paper proposes the first free-style text-to-face method namely AnyFace enabling much wider open world applications such as metaverse, social media, cosmetics, forensics, etc. AnyFace has a novel two-stream framework for face image synthesis and manipulation given arbitrary descriptions of the human face. Specifically, one stream performs text-to-face generation and the other conducts face image reconstruction. Facial text and image features are extracted using the CLIP (Contrastive Language-Image Pre-training) encoders. And a collaborative Cross Modal Distillation (CMD) module is designed to align the linguistic and visual features across these two streams. Furthermore, a Diverse Triplet Loss (DT loss) is developed to model fine-grained features and improve facial diversity. Extensive experiments on Multi-modal CelebA-HQ and CelebAText-HQ demonstrate significant advantages of AnyFace over state-of-the-art methods. AnyFace can achieve high-quality, high-resolution, and high-diversity face synthesis and manipulation results without any constraints on the number and content of input captions.

研究の動機と目的

  • 既存のテキストから画像へのモデルが顔の生成に限定して固定されたデータセット内キャプションに依存するという制限を解消すること。
  • 任意の数、内容、形式のテキスト記述から自由形式の顔の生成と操作を可能にすること。
  • 一対一のテキスト-画像特徴マッチングを超えて、テキスト誘導型顔生成における顔の多様性と意味的整合性を向上させること。
  • メタバース、ソーシャルメディア、デジタル化粧品などのオープンワールド応用をサポートするフレームワークを開発すること。
  • 従来の方法における固定キャプションテンプレートと限られた語彙の制約を、独創的なクロスモーダル蒸留とトリプレット損失機構によって克服すること。

提案手法

  • 二ストリームフレームワークを提案:一方のストリームはテキストから顔の生成を、もう一方は顔画像の再構築を担当し、クロスモーダル相互作用を介して独立に訓練される。
  • CLIPエンコーダーがテキストおよび画像特徴を抽出し、データセット外の記述に対してもゼロショット一般化を可能にする。
  • クロスモーダル蒸留(CMD)モジュールが、一対一の特徴マッチングを厳密に要求しないクロスモーダル転送損失を介して、言語的および視覚的特徴を統合する。
  • 多様なトリプレット損失(DT損失)を導入し、髪型やアクセサリーなどの細分化された顔貌特徴を促進しながら、テキストの関連性を維持する。
  • テキスト埋め込みサイズの調整により、顔の操作における連続的制御を可能にし、属性間の滑らかな遷移を実現する。
  • StyleGANベースの生成とCLIPでエンコードされたテキストプロンプトを活用し、リアルな高解像度顔の生成を実現する。
Figure 2 : Overview of AnyFace. It consists of a face synthesis network and a face reconstruction network. Text Enc and Image Enc represent CLIP text and image encoder respectively. Dec is the pre-trained StyleGAN decoder. (a) Detailed architecture of Cross Modal Distillation (CMD) module. (b) For t
Figure 2 : Overview of AnyFace. It consists of a face synthesis network and a face reconstruction network. Text Enc and Image Enc represent CLIP text and image encoder respectively. Dec is the pre-trained StyleGAN decoder. (a) Detailed architecture of Cross Modal Distillation (CMD) module. (b) For t

実験結果

リサーチクエスチョン

  • RQ1固定されたテンプレートや語彙に依存せずに、データセット外の任意のテキスト記述に対してもテキストから顔へのモデルが一般化可能か?
  • RQ2複雑なマルチキャプション記述に対し、高い意味的整合性を維持しながら、テキストから画像への生成における顔の多様性をどのように向上できるか?
  • RQ3一対一のテキスト-画像特徴マッチングを、より柔軟な一対多のアライメント戦略に置き換えると、どのような影響を及ぼすか?
  • RQ4クロスモーダル蒸留とトリプレット損失を備えた二ストリームフレームワークは、既存のマルチキャプション T2I メソッドに比べ、顔の生成および操作でより優れた性能を達成できるか?
  • RQ5自然言語記述を用いて、どの程度連続的かつ細分化された顔の操作が可能になるか?

主な発見

  • AnyFace は Multi-modal CelebA-HQ および CelebAText-HQ で最先端の性能を達成し、先行手法に比べて FID と視覚的品質において顕著な向上を示した。
  • 多様なトリプレット損失(DT損失)は顔の多様性を顕著に向上させ、笑顔や短い髪といった共通の特徴への過剰適合を低減した。
  • クロスモーダル転送損失(CMT)は収束を加速させ、FID を改善した。完全なモデルは、アブレーションバージョンに比べてより速く低い FID 値に到達した。
  • 定性的な結果から、AnyFace は抽象的または複文の記述(例:「悪い知らせ」が悲しげな表情を生成)に対しても、リアルで多様な顔を生成できることを示した。
  • テキスト誘導型操作では連続的制御が可能である:テキストの関連性を高めると、髪の色、表情、年齢などの属性変更が滑らかで正確に実現された。
  • モデルはデータセット外の記述に対しても一般化に成功した。例として、「博士号」に対して「マントルボード」、「プログラマー」に対して「光頭」を適切に認識し、意味的コンセプトのゼロショット理解を示した。
Figure 3 : Comparison between (a) pairwise loss and (b) diverse triplet loss. The pairwise loss learns an one-to-one mapping from text embedding $w_{t}$ to target $w$ , but in fact it often converges to average embedding $\overline{w}$ with an unique result. In contrast, diverse triplet loss follows
Figure 3 : Comparison between (a) pairwise loss and (b) diverse triplet loss. The pairwise loss learns an one-to-one mapping from text embedding $w_{t}$ to target $w$ , but in fact it often converges to average embedding $\overline{w}$ with an unique result. In contrast, diverse triplet loss follows

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。