Skip to main content
QUICK REVIEW

[論文レビュー] Key-Locked Rank One Editing for Text-to-Image Personalization

Yoad Tewel, Rinon Gal|arXiv (Cornell University)|May 2, 2023
Advanced Image and Video Retrieval Techniques被引用数 6
ひとこと要約

Perfusionは、1つのコンセププトあたり100KBで、高視覚的忠実度と強力なテキストアライメントを達成する、キーロックされたランク1編集手法を導入する。コンセププトのキーをそのスーパーカテゴリの埋め込みにロックし、値の投影にゲーテッドランク1更新を適用することで、実行時におけるコンセプト影響力の制御が可能となり、マルチコンセプトの組み合わせも可能になる。再トレーニングを必要とせず、忠実度とアライメントのトレードオフのパレートフロントをカバーする。

ABSTRACT

Text-to-image models (T2I) offer a new level of flexibility by allowing users to guide the creative process through natural language. However, personalizing these models to align with user-provided visual concepts remains a challenging problem. The task of T2I personalization poses multiple hard challenges, such as maintaining high visual fidelity while allowing creative control, combining multiple personalized concepts in a single image, and keeping a small model size. We present Perfusion, a T2I personalization method that addresses these challenges using dynamic rank-1 updates to the underlying T2I model. Perfusion avoids overfitting by introducing a new mechanism that "locks" new concepts' cross-attention Keys to their superordinate category. Additionally, we develop a gated rank-1 approach that enables us to control the influence of a learned concept during inference time and to combine multiple concepts. This allows runtime-efficient balancing of visual-fidelity and textual-alignment with a single 100KB trained model, which is five orders of magnitude smaller than the current state of the art. Moreover, it can span different operating points across the Pareto front without additional training. Finally, we show that Perfusion outperforms strong baselines in both qualitative and quantitative terms. Importantly, key-locking leads to novel results compared to traditional approaches, allowing to portray personalized object interactions in unprecedented ways, even in one-shot settings.

研究の動機と目的

  • テキスト対画像のパーソナライゼーションにおける過学習、特にアテンションの'Where'パス(キー)における過学習を解消すること。これは、テキストアライメントと一般化性能の低下を引き起こす。
  • ステートオブアート手法と比較して5桁小さくなるモデルサイズを維持しながら、高視覚的忠実度と強力なテキストアライメントを実現すること。
  • 制御可能なゲーティング機構により、実行時における視覚的忠実度とテキストアライメントのバランスを動的に制御できること。
  • 複数の独立してトレーニングされたコンセプトを1つのプロンプトに組み合わせられること、特にそれらの間の複雑な相互作用を可能とすること。
  • スーパーカテゴリベースのキーロッキングにより、1ショットパーソナライゼーションがより頑健で一般化性能に優れたものとなるようにすること。

提案手法

  • コンセプトのキーをそのスーパーカテゴリ(例:'teddybear' は 'teddy' にロックされる)のキーに固定するキーロッキング機構を導入し、特定の空間的レイアウトへの過学習を防ぐ。
  • 値の投影を拡張された潜在空間とみなして、入力単語埋め込みと同時に最適化することで、視覚的外観を符号化する。
  • KおよびVの投影行列にゲーテッドランク1更新を適用し、推論時にコンセプト更新の適用を選択的に可能にする。
  • 推論時にコンセプト影響力の強さを制御するゲーティング機構を用い、再トレーニングやモデル特化なしに、視覚的忠実度とテキストアライメントの間の実行時トレードオフを可能にする。
  • 2パスウェイアテンションのビューを採用:キーを'Where'(空間的レイアウト)とし、値を'What'(視覚的外観)とする。パーソナライゼーションは主に'What'パスに集中する。
  • 学習の安定化とアライメントの向上を図るために、再構成プロンプトを用いてトレーニングを行う。特にスーパーカテゴリキーのロックと組み合わせると顕著である。

実験結果

リサーチクエスチョン

  • RQ1パーソナライズされたコンセプトのクロスアテンションキーをそのスーパーカテゴリにロックすることで、過学習が軽減され、テキストアライメントが向上するか?
  • RQ2ゲーテッドランク1更新機構により、実行時におけるコンセプト影響力の制御が可能になり、テキスト対画像生成におけるマルチコンセプトの組み合わせが可能になるか?
  • RQ3100KBのモデルが、フルファインチューニング手法と同等の性能を達成しつつ、高視覚的忠実度とアライメントを維持できるか?
  • RQ4キーロッキングは、1ショットまたはゼロショット設定において、トレーニングダイナミクスと一般化性能にどのように影響するか?
  • RQ5ヴァナラのdiffusionモデルでトレーニングされたコンセプトは、ファインチューニングされたバージョン(例:InkPunk-v2 や Protogen-v3.4)にゼロショットで転送可能か?

主な発見

  • Perfusionは、1つのコンセプトあたり100KBのモデルサイズで、高視覚的忠実度と強力なテキストアライメントを達成しており、ステートオブアート手法と比較して5桁小さい。
  • キーロッキングにより、アテンションの'Where'パスにおける過学習が顕著に軽減され、ベースライン手法と比較してテキストアライメントスコアが向上した。
  • ゲーテッドランク1更新により、再トレーニングやモデル特化なしに、視覚的忠実度とテキストアライメントの間の実行時バランスが可能になった。
  • Perfusionは、1つのプロンプトに複数の独立してトレーニングされたコンセプトを組み合わせることができ、例えばテディベアがティーポットをもっているような新しい相互作用を可能にする。
  • この手法はファインチューニングされたdiffusionモデル(例:InkPunk-v2、Protogen-v3.4)にも一般化可能であり、ゼロショット転送能力を示した。
  • 1ショットトレーニングでも性能の低下はわずかであり、再構成プロンプトによりトレーニングダイナミクスが安定化し、視覚的忠実度が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。