Skip to main content
QUICK REVIEW

[論文レビュー] Portrait Diffusion: Training-free Face Stylization with Chain-of-Painting

Jin Liu, Huaibo Huang|arXiv (Cornell University)|Dec 3, 2023
Face recognition and analysis被引用数 4
ひとこと要約

Portrait Diffusion は、微調整を必要としないトレーニングフリーの顔スタイル化フレームワークであり、事前学習済みのテキストから画像への拡散モデルを活用して、微調整なしに詳細なポートレートスタイルを転送する。顔の潜在コードの逆問題と、新しいスタイルアテンション制御機構を用いて、アテンション空間でコンテンツとスタイルの特徴を融合する。同時に、Chain-of-Painting を用いて反復的リファインメントを実現し、品質の向上とマルチスタイル転送を実現する。

ABSTRACT

Face stylization refers to the transformation of a face into a specific portrait style. However, current methods require the use of example-based adaptation approaches to fine-tune pre-trained generative models so that they demand lots of time and storage space and fail to achieve detailed style transformation. This paper proposes a training-free face stylization framework, named Portrait Diffusion. This framework leverages off-the-shelf text-to-image diffusion models, eliminating the need for fine-tuning specific examples. Specifically, the content and style images are first inverted into latent codes. Then, during image reconstruction using the corresponding latent code, the content and style features in the attention space are delicately blended through a modified self-attention operation called Style Attention Control. Additionally, a Chain-of-Painting method is proposed for the gradual redrawing of unsatisfactory areas from rough adjustments to fine-tuning. Extensive experiments validate the effectiveness of our Portrait Diffusion method and demonstrate the superiority of Chain-of-Painting in achieving precise face stylization. Code will be released at \url{https://github.com/liujin112/PortraitDiffusion}.

研究の動機と目的

  • 各スタイルごとに時間がかかり、ストレージを多く消費する微調整を必要とする従来の顔スタイル化手法の限界を解消すること。
  • 顔のアイデンティティや髪の毛の質感、アイシャドーなどの局所的詳細を保持しつつ、正確で細分化されたスタイル転送を可能にすること。
  • 再トレーニングなしに任意の参照ポートレートを用いて柔軟にスタイル転送を可能にするゼロショットフレームワークの開発。
  • 不満な領域の改善と、異なる顔の属性に対して複数のスタイルを適用可能なプログレッシブなリファインメントパラダイムの導入。

提案手法

  • DDIM Inversion を用いて、ソースおよび参照顔画像を潜在コードに変換し、コンテンツとスタイルの表現を取得する。
  • 標準的な自己アテンションを、二重ブランチのクロスアテンションを用いてコンテンツとスタイル特徴を調整比で調和的に融合するスタイルアテンション制御に置き換える。
  • クエリの混同を低減するため、ソースおよび参照マスクを用いて意味的に整合した領域にアテンションを制限するマスクプロンプトスタイルアテンション制御を導入する。
  • 属性固有のマスクを用いて、特定の顔領域に段階的にスタイル化を適用する、逐次的リファインメントプロセスであるChain-of-Paintingを実装する。
  • アテンション機構内の融合比を調整するスタイルガイドランスケールを用いて、スタイル化の強度を制御する。
  • 人間のフィードバックを活用し、Chain-of-Paintingにおけるターゲットリファインメントのための顔の属性マップの選択をガイドする。

実験結果

リサーチクエスチョン

  • RQ1微調整なしに、事前学習済みの拡散モデルを微調整せずに、高忠実度で細分化されたポートレートスタイル化を達成できるか?
  • RQ2アテンション空間において、コンテンツとスタイル特徴を効果的に融合させることで、顔のアイデンティティを保持しつつ、複雑な芸術的スタイルを転送できるか?
  • RQ3反復的かつ領域特化型のリファインメントは、単一生成アプローチを上回るスタイル化品質を向上させられるか?
  • RQ41つのフレームワークを用いて、複数の異なるポートレートスタイルを、顔の異なる属性(例:髪の毛を1つのスタイル、目を別のスタイル)に同時に適用できるか?
  • RQ5本手法は、微調整に基づく最先端の手法と比較して、ユーザーの好みと効率性において優れているか?

主な発見

  • 人間評価において、Portrait Diffusion は 30.26% のユーザー好み率を達成し、次に良い手法(JoJoGAN が 20.52%)を顕著に上回った。
  • 他の手法が微調整に 48.52 秒から 2000 秒以上を要するのに対し、本手法は微調整に 0 秒を要した。
  • 視覚的アブレーション実験では、スタイルアテンション制御を除去した場合、顕著な意味的歪みとアーティファクトが生じ、コンテンツの整合性を保つ役割を果たしていることが確認された。
  • Chain-of-Painting により、不満な領域の効果的なリファインメントが可能となり、髪の毛の質感やアイシャドーといった局所的詳細が向上しながらも、アイデンティティは維持された。
  • Chain-of-Painting を用いて、複数の参照画像とマスクを用いて、複数のスタイルを異なる顔の属性(例:髪の毛を1つのスタイル、目を別のスタイル)に効果的に転送できた。
  • VCT や InST などの拡散ベースのベースラインと比較して、Portrait Diffusion は、特に表情や複雑なテクスチャを含む困難なケースにおいて、より優れたコンテンツの一貫性とスタイル忠実度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。