Skip to main content
QUICK REVIEW

[論文レビュー] Face Aging via Diffusion-based Editing

Xiangyi Chen, Stéphane Lathuilière|arXiv (Cornell University)|Sep 20, 2023
Generative Adversarial Networks and Image SynthesisComputer Science参考文献 41被引用数 3
ひとこと要約

本論文では、大規模な言語・画像拡散モデルを活用して現実的な年齢変換を生成する、顔の年齢変化を初めて拡散ベースで実現するFADINGを提案する。事前学習済みの拡散モデルを年齢に配慮した微調整により特化させ、入力画像を潜在ノイズに逆方向変換し、二重プロンプトを用いたテキスト誘導型アテンション制御を適用することで、多様な年齢範囲や困難な条件下でも優れた年齢推定精度、属性の保存性、画像品質を達成する。

ABSTRACT

In this paper, we address the problem of face aging: generating past or future facial images by incorporating age-related changes to the given face. Previous aging methods rely solely on human facial image datasets and are thus constrained by their inherent scale and bias. This restricts their application to a limited generatable age range and the inability to handle large age gaps. We propose FADING, a novel approach to address Face Aging via DIffusion-based editiNG. We go beyond existing methods by leveraging the rich prior of large-scale language-image diffusion models. First, we specialize a pre-trained diffusion model for the task of face age editing by using an age-aware fine-tuning scheme. Next, we invert the input image to latent noise and obtain optimized null text embeddings. Finally, we perform text-guided local age editing via attention control. The quantitative and qualitative analyses demonstrate that our method outperforms existing approaches with respect to aging accuracy, attribute preservation, and aging quality.

研究の動機と目的

  • 既存の顔の年齢変化手法が単一の偏りのある限られたスケールの顔データセットに依存するという限界を解消すること。
  • 大規模なテキストから画像への拡散モデルの豊富な意味的・視覚的事前知識を活用し、より強固で一般化可能な顔の年齢変化を実現すること。
  • 大規模な年齢ギャップや、遮蔽や極端なポーズといった困難な条件下でも正確な年齢変化を実現すること。
  • 年齢関連の属性を、性別や表情といったアイデンティティを保持する特徴から分離すること。
  • 最先端のGANベースの手法を上回る年齢変化の品質、リアルさ、属性の忠実度を実現する手法を開発すること。

提案手法

  • 性別やアイデンティティといった年齢に無関係な特徴と年齢を分離できるように、年齢に配慮した微調整を用いて事前学習済みの拡散モデルを特化させる。
  • 構造的詳細を保持するために、適切に選択された逆方向変換技術を用いて入力顔画像を潜在ノイズに変換する。
  • 編集をガイドするため、逆方向変換された潜在表現から最適化されたヌルテキスト埋め込みを生成する。
  • 二重プロンプト方式を用いてアテンション制御による局所的年齢編集を実行:一方のプロンプトで元の年齢を指定し、もう一方でターゲット年齢を指定する。
  • 「女性」「笑顔」などの意味的属性を組み込んだ強化プロンプトを用い、アテンションのターゲティングと属性の保存性を向上させる。
  • 初期の年齢推定結果を編集プロンプトに組み込んで、モデルのずれを防ぎ、意味のある年齢進行を保証する。
(b) Age editing: given an input image, the diffusion process is inverted. The image is then edited replacing the estimated age with the target age.
(b) Age editing: given an input image, the diffusion process is inverted. The image is then edited replacing the estimated age with the target age.

実験結果

リサーチクエスチョン

  • RQ1大規模なテキストから画像への拡散モデルを、一般の画像編集を超えて顔の年齢変化というタスクに効果的に特化させることは可能か?
  • RQ2年齢に配慮した微調整は、性別や表情といったアイデンティティに無関係な属性から年齢をどれほど効果的に分離するか?
  • RQ3アテンション制御を伴う二重プロンプト編集方式は、年齢推定精度と構造的整合性をどの程度向上させるか?
  • RQ4意味的属性を組み込んだ強化プロンプトは、属性の保存性と年齢変化のリアルさの両方を向上させるか?
  • RQ5編集プロンプトに初期年齢情報を組み込むことで、モデルが意味のある年齢変化を生成する能力にどのような影響を与えるか?

主な発見

  • FADINGは、比較対象手法の中で最小のFréchet Inception Distance (FID) と KID スコア(0.660 × 100)を達成し、優れた画像品質と分布類似性を示している。
  • 年齢予測誤差(MAE)は9.162年まで低減され、トレーニングフリーのベースライン(9.830)とシングルプロンプト変種(8.781)を上回り、年齢推定精度の向上を実証した。
  • 属性の保存性が顕著に向上:性別の一貫性は84.10%に達し、トレーニングフリーのベースライン(79.90%)とシングルプロンプト変種(81.95%)を上回った。
  • 二重プロンプト方式によりぼやけが軽減され、構造的整合性が向上し、両方のプロンプトを使用した際のKIDスコアは0.707から0.660に低下した。
  • アブレーションスタディにより、強化プロンプトと初期年齢ガイドが不可欠であることが確認された:これらを除去するとMAEは4.543、KIDは0.504上昇し、性能が劣化した。
  • 定性的な結果では、特に口元や顔の輪郭といった困難な領域でも、最小限のアーチファクトと向上したリアルさが観察され、大規模な年齢ギャップ下でも有効であった。
Figure 2 : Qualitative comparison with state-of-the-art methods on CelebA-HQ. Images for the other approaches are extracted from [ Gomez-Trenado et al.(2022)Gomez-Trenado, Lathuilière, Mesejo, and Cordón ] .
Figure 2 : Qualitative comparison with state-of-the-art methods on CelebA-HQ. Images for the other approaches are extracted from [ Gomez-Trenado et al.(2022)Gomez-Trenado, Lathuilière, Mesejo, and Cordón ] .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。