Skip to main content
QUICK REVIEW

[論文レビュー] Generate Anything Anywhere in Any Scene

Yuheng Li, Haotian Liu|arXiv (Cornell University)|Jun 29, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

PACGenは、微調整中のデータ拡張を通じてオブジェクトのアイデンティティと空間的属性を分離することにより、高精細な個人化されたオブジェクト生成と正確な局所化制御を両立する新しいテキストから画像への拡散モデルを導入する。推論時にGLIGENのアダプタ層を統合し、領域ガイド付きサンプリングを採用することで、PACGenは、既存の手法と比較して優れた画像品質と制御性を備えた、あらゆるシーンにおいて任意の位置とサイズに個人化されたオブジェクトを生成可能である。

ABSTRACT

Text-to-image diffusion models have attracted considerable interest due to their wide applicability across diverse fields. However, challenges persist in creating controllable models for personalized object generation. In this paper, we first identify the entanglement issues in existing personalized generative models, and then propose a straightforward and efficient data augmentation training strategy that guides the diffusion model to focus solely on object identity. By inserting the plug-and-play adapter layers from a pre-trained controllable diffusion model, our model obtains the ability to control the location and size of each generated personalized object. During inference, we propose a regionally-guided sampling technique to maintain the quality and fidelity of the generated images. Our method achieves comparable or superior fidelity for personalized objects, yielding a robust, versatile, and controllable text-to-image diffusion model that is capable of generating realistic and personalized images. Our approach demonstrates significant potential for various applications, such as those in art, entertainment, and advertising design.

研究の動機と目的

  • 個人化されたテキストから画像への拡散モデルにおけるオブジェクトのアイデンティティと位置・サイズのエンタングルメントを解消すること。
  • 生成されたシーンにおける個人化オブジェクトの位置とスケールに対する細かい制御を可能にすること。
  • 個人化と局所化の制御性を両立させつつ、高い画像忠実度を維持すること。
  • 個人化後、局所化のための追加微調整が不要な手法を開発すること。
  • トレーニング中にデータ拡張によって引き起こされるアーティファクト(例:コラージュ効果)を軽減すること。

提案手法

  • DreamBooth風の微調整中に、ユーザーが提供した画像をランダムにリサイズおよび再配置することで、オブジェクトのアイデンティティと空間的属性を分離する。
  • 推論時に事前学習済みのGLIGENアダプタ層を微調整済み拡散モデルに統合し、位置とサイズの制御を可能にする。
  • ネガティブプロンプト、ダイバーシティプロンプト、抑制プロンプトの3つの専用プロンプトを用いた領域ガイド付きサンプリング戦略を採用する。
  • スケール5の分類器フリー・ガイドランスとスケジュールドサンプリング(τ = 0.3)を活用し、画像品質とレイアウトの正確性のバランスを取る。
  • CLIP特徴量を用いてコラージュ分類器を訓練し、データ拡張によるアーティファクトの導入を定量的に評価・アブレーションする。
  • バッチサイズ2でStable Diffusion v1.4を1000イテレーション微調整し、ランダムリサイズスケールs = 0.3を用いる。

実験結果

リサーチクエスチョン

  • RQ1微調整中のデータ拡張が、個人化拡散モデルにおけるオブジェクトのアイデンティティと空間的属性の分離に効果的に機能するか。
  • RQ2GLIGENアダプタの統合が、再トレーニングなしに局所化制御を可能にする程度はどの程度か。
  • RQ3領域ガイド付きサンプリングが、画像品質の向上とコラージュ効果などのアーティファクトの低減にどのように寄与するか。
  • RQ4マルチコンセプト個人化が属性の一貫性と生成忠実度に与える影響は何か。
  • RQ5領域ガイド付きサンプリングプロンプトの各要素が、全体のパフォーマンスにどのように寄与しているか。

主な発見

  • 提案されたデータ拡張戦略により、生成画像間のLPIPS距離が0.6583から0.5489に低下し、分離によって一貫性が向上し多様性が低下したことが示された。
  • アブレーションスタディの結果、3つの領域ガイド付きプロンプトのいずれかを削除すると顕著なアーティファクトが生じる:ネガティブプロンプトが欠落すると、特に小さなオブジェクトに対してコラージュ効果が顕著に現れる。
  • 抑制プロンプトが欠落すると、誤った位置に不要な重複インスタンスが生成されるため、レイアウトの忠実度を維持する役割を果たしていることが示された。
  • 定性的な結果から、PACGenは、複雑なシーンでさえも、高忠実度で任意の位置に個人化されたオブジェクトを正確に配置できることを示した。
  • モデルは、複数オブジェクトのコンポジション、アートスタイル変換、属性編集など、多様な応用を可能にしつつ、局所化制御を保持している。
  • A6000 GPU上では推論時間が1枚あたり5秒から8秒に増加するが、モデルの頑健性と制御性の向上により、これを相殺できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。