Skip to main content
QUICK REVIEW

[論文レビュー] DreamIdentity: Improved Editability for Efficient Face-identity Preserved Image Generation

Zhuowei Chen, Shancheng Fang|arXiv (Cornell University)|Jul 1, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

DreamIdentityは、顔のアイデンティティを保持する画像生成のための最適化不要で効率的な手法を提案する。M² IDエンコーダーを導入し、マルチスケールで顔に特化した特徴量とマルチワード埋め込みを用いてアイデンティティ表現を向上させる。さらに、T2Iモデルを活用してペaired編集データを自己増強的に生成する編集可能性学習を導入し、推論時最適化を必要とせず、高いアイデンティティ保持性と柔軟なテキスト誘導型編集を実現する。

ABSTRACT

While large-scale pre-trained text-to-image models can synthesize diverse and high-quality human-centric images, an intractable problem is how to preserve the face identity for conditioned face images. Existing methods either require time-consuming optimization for each face-identity or learning an efficient encoder at the cost of harming the editability of models. In this work, we present an optimization-free method for each face identity, meanwhile keeping the editability for text-to-image models. Specifically, we propose a novel face-identity encoder to learn an accurate representation of human faces, which applies multi-scale face features followed by a multi-embedding projector to directly generate the pseudo words in the text embedding space. Besides, we propose self-augmented editability learning to enhance the editability of models, which is achieved by constructing paired generated face and edited face images using celebrity names, aiming at transferring mature ability of off-the-shelf text-to-image models in celebrity faces to unseen faces. Extensive experiments show that our methods can generate identity-preserved images under different scenes at a much faster speed.

研究の動機と目的

  • 個々のアイデンティティに対する最適化を要しないテキストから画像への生成において、顔のアイデンティティを保持する課題に対処すること。
  • 従来の最適化不要な手法におけるアイデンティティ保持性とモデルの編集可能性のトレードオフを克服すること。
  • 一般的なエンコーダー(例:CLIP)を置き換えることで、顔に特化したマルチスケール特徴量エンコーダーを用いてアイデンティティ表現を向上させること。
  • トレーニング段階に編集タスクを統合することで、トレーニングと推論の目的を一致させ、編集可能性を維持すること。
  • 1枚の入力顔画像のみを用いて、さまざまなシーンで多様でアイデンティティ一貫性のある画像を、効率的かつリアルタイムに生成できること。

提案手法

  • 顔画像からマルチスケール特徴量を抽出し、それをVision Transformerに基づくM² IDエンコーダーが処理し、テキスト埋め込み空間内の複数のワード埋め込みに射影する。
  • マルチ埋め込みプロジェクタを用いて、単一の埋め込みよりも顔固有の詳細をよりよく捉える複数の擬似語を生成する。
  • 事前学習済みT2Iモデルを活用して、ペアド画像(元の有名人顔と編集済みバージョン、例:「警察官として」)を生成する自己増強的編集可能性学習を導入する。
  • 実際の顔再構築データ(FFHQから)と自己増強された編集ペアデータの組み合わせデータセット上でM² IDエンコーダーを学習させ、アイデンティティ忠実度と編集可能性の両方を向上させる。
  • 個々のアイデンティティに対する最適化を一切回避することで、入力顔1つあたり1回の順伝播で推論効率を維持する。
  • ControlNetと統合することで空間的制御を可能とし、視線誘導型レイアウト制御を用いたアイデンティティ保持型のシーン切り替えを実現する。

実験結果

リサーチクエスチョン

  • RQ1軽量で最適化不要なエンコーダーは、CLIPベースのベースラインと比較して優れたアイデンティティ保持性を達成できるか?
  • RQ2自己増強的編集可能性学習は、多様なテキストプロンプトに適応する能力を向上させるとともに、アイデンティティを維持できるか?
  • RQ3マルチスケール特徴抽出とマルチワード埋め込みプロジェクションは、アイデンティティ表現の正確性にどのように影響するか?
  • RQ4アイデンティティ保持性とテキスト整合性のバランスを取る最適な埋め込み数は何か?
  • RQ5微調整なしで、未観測のアイデンティティや複雑な編集シナリオに一般化可能か?

主な発見

  • M² IDエンコーダーは、マルチスケールで顔に特化した特徴量を活用することで、アイデンティティ保持性をCLIPベースラインの0.266から0.412に向上させた。
  • 2つのワード埋め込みを用いることで、顔類似度が12%向上したが、テキスト整合性はわずか0.4%低下した。3つ以上の埋め込みは編集可能性を損なう傾向にあった。
  • 自己増強的編集可能性学習は、編集能力を顕著に向上させた。この学習を経ずに訓練されたモデルは、正しく編集された出力を生成できず(例:「警察官として」)、誤った出力となった。
  • 実際の再構築データ(FFHQ)と自己増強された編集データの組み合わせ学習により、単体で使用する場合よりも顔類似度とプロンプト適合性の両方が向上した。
  • 本手法は、推論時最適化を一切必要とせず、1回の順伝播で高品質でアイデンティティ保持型の画像生成が可能である。
  • 定性的な結果から、衣装、ポーズ、背景の変更を含む多様なシーンや編集プロンプトにおいても、一貫したアイデンティティ保持が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。