Skip to main content
QUICK REVIEW

[論文レビュー] Encoder-based Domain Tuning for Fast Personalization of Text-to-Image Models

Rinon Gal, Moab Arar|arXiv (Cornell University)|Feb 23, 2023
Topic Modeling被引用数 5
ひとこと要約

本稿では、11秒未塔で5ステップの学習のみでテキスト対画像拡散モデルのワンショット個人化を実現するエンコーダベースのドメインチューニング手法を提案する。大規模なドメイン固有のデータセット上で概念エンコーダと正則化された重みオフセットを同時に学習することで、高速かつ高忠実度の個人化を実現するとともに、アイデンティティの保持とストレージコストの低減を達成する。

ABSTRACT

Text-to-image personalization aims to teach a pre-trained diffusion model to reason about novel, user provided concepts, embedding them into new scenes guided by natural language prompts. However, current personalization approaches struggle with lengthy training times, high storage requirements or loss of identity. To overcome these limitations, we propose an encoder-based domain-tuning approach. Our key insight is that by underfitting on a large set of concepts from a given domain, we can improve generalization and create a model that is more amenable to quickly adding novel concepts from the same domain. Specifically, we employ two components: First, an encoder that takes as an input a single image of a target concept from a given domain, e.g. a specific face, and learns to map it into a word-embedding representing the concept. Second, a set of regularized weight-offsets for the text-to-image model that learn how to effectively ingest additional concepts. Together, these components are used to guide the learning of unseen concepts, allowing us to personalize a model using only a single image and as few as 5 training steps - accelerating personalization from dozens of minutes to seconds, while preserving quality.

研究の動機と目的

  • 長時間のファインチューニングと複数枚の画像を必要とする従来のテキスト対画像個人化手法が抱える高い計算コストとストレージコストを低減すること。
  • 新しい概念の一般化可能でドメインに適応した初期化を学習することで、アイデンティティの崩壊や背景の詳細への過学習を回避すること。
  • 同じドメインからの新しい概念を、1枚の画像と最小限のトレーニングステップでのみ迅速に個人化できること。
  • 反復的エンコーダと学習可能な重みオフセットを統合した共同学習フレームワークを導入し、一般化性能と編集可能性を向上させること。
  • 各新しいアイデンティティ用に別々のモデルチェックポイントを保持する必要がなく、推論時における個人化を可能にすることで、デプロイのオーバーヘッドを削減すること。

提案手法

  • テキスト対画像モデルのノイズ除去ステップ中に反復的リファインメントを用いて、ターゲット概念の1枚の入力画像を単語埋め込み表現にマップする専用のエンコーダネットワークを学習する。
  • フルモデルのファインチューニングではなく、ハイパーネットワークに基づくアプローチを用いて、テキスト対画像モデルのアテンションプロジェクション行列の低ランクで正則化された重みオフセットを学習する。
  • 大規模なドメイン固有のデータセット(例:顔用にFFHQ、ネコ用にLSUN Cats)上でエンコーダと重みオフセットを共同で事前学習し、強力でドメインに適応した初期化を確立する。
  • 推論時、1枚の新しい概念画像を用いて、単一のA100 GPUで5ステップのみの学習でエンコーダと重みオフセットをファインチューニングする。
  • 反復的エンコーダを活用し、各ステップでノイズ除去プロセスを観測することで、動的な補正が可能となり、ターゲット概念との整合性が向上する。
  • ハイパーネットワークによるスムーズネスプライアーオフセット空間を制約し、不自然な画像詳細への過学習を防ぐ。

実験結果

リサーチクエスチョン

  • RQ11枚の画像による個人化手法は、最小限のトレーニング時間とストレージコストで高忠実度の結果を達成できるか?
  • RQ2事前学習モデルをどのように初期化すれば、同じドメインの未観測概念に一般化可能になるか?
  • RQ3反復的エンコーダのリファインメントは、拡散プロセス中における埋め込み品質と概念の一貫性をどの程度向上できるか?
  • RQ4エンコーダと重みオフセットの共同事前学習により、フルモデルの再トレーニングなしに推論時における高速個人化が可能になるか?
  • RQ5顔のデータセットで学習したモデルを、顔とはかけ離れた概念(例:木製のおもちゃ)に適用した場合のドメイン一般化の限界は何か?

主な発見

  • 本手法により、1枚のA100 GPUで個人化時間を数分からわずか11秒に短縮し、従来手法比で60倍~140倍の高速化を達成した。
  • 5ステップの学習と1枚の画像のみで、多様なプロンプトにおいて高忠実度でアイデンティティを保持した生成が可能となった。
  • 反復的エンコーダはノイズ除去の全過程で実世界のドメインに近い埋め込みを維持し、過学習の低減と編集可能性の向上に寄与した。
  • ドメイン内での一般化性能は良好であり、ネコで学習したモデルを用いたドッグの個人化でも高品質な結果が得られたが、距離の遠いドメインでは性能が低下した。
  • 顔やネコのデータセットで学習したモデルを用いて木製のおもちゃのようなアウトオブドメインの概念を個人化しようとすると失敗し、ドメイン固有の制限が顕在した。
  • 共同事前学習による強いプライアーオンにより、1枚の画像でのファインチューニングでもモデルの品質が維持され、アイデンティティの崩壊を回避できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。