[論文レビュー] DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter
DreamArtist++ は、1枚の参照画像から学習する一括テキスト-to-画像生成のためのポジティブ・ネガティブプロンプトチューニング手法を提案する。ペアドされたポジティブおよびネガティブ埋め込みを用いて、特徴の保持と生成の多様性のバランスを図る。画像の質、多様性、制御性において最先端の性能を達成し、従来の手法(Textual Inversion や DreamBooth)を定量的ベンチマークおよび人間評価の両面で上回る。
State-of-the-arts text-to-image generation models such as Imagen and Stable Diffusion Model have succeed remarkable progresses in synthesizing high-quality, feature-rich images with high resolution guided by human text prompts. Since certain characteristics of image content \emph{e.g.}, very specific object entities or styles, are very hard to be accurately described by text, some example-based image generation approaches have been proposed, \emph{i.e.} generating new concepts based on absorbing the salient features of a few input references. Despite of acknowledged successes, these methods have struggled on accurately capturing the reference examples' characteristics while keeping diverse and high-quality image generation, particularly in the one-shot scenario (\emph{i.e.} given only one reference). To tackle this problem, we propose a simple yet effective framework, namely DreamArtist, which adopts a novel positive-negative prompt-tuning learning strategy on the pre-trained diffusion model, and it has shown to well handle the trade-off between the accurate controllability and fidelity of image generation with only one reference example. Specifically, our proposed framework incorporates both positive and negative embeddings or adapters and optimizes them in a joint manner. The positive part aggressively captures the salient characteristics of the reference image to drive diversified generation and the negative part rectifies inadequacies from the positive part. We have conducted extensive experiments and evaluated the proposed method from image similarity (fidelity) and diversity, generation controllability, and style cloning. And our DreamArtist has achieved a superior generation performance over existing methods. Besides, our additional evaluation on extended tasks, including concept compositions and prompt-guided image editing, demonstrates its effectiveness for more applications.
研究の動機と目的
- 1枚の参照画像のみを用いる際の、従来の1括テキスト-to-画像生成手法が抱える過学習および制御性の欠如という限界を是正すること。
- 望ましいおよび望ましくない視覚的特徴を捉える二重埋め込み学習戦略を導入することで、生成の多様性と忠実度を向上させること。
- スタイルトランスファー、オブジェクトの構成、プロンプト誘導型編集を含む、複雑な記述に対しても高品質で制御可能な画像生成を可能にすること。
- テキストプロンプトおよび参照コンテンツと強い整合性を保ちつつ、複数の参照画像への依存を低減すること。
- パラメータ効率的であり、既存の拡散モデルと互換性があるため、広範な展開が可能な手法を開発すること。
提案手法
- DreamArtist++ は、ポジティブ・ネガティブプロンプトチューニング(PNPT)戦略を採用し、2つの埋め込みを同時に学習する:参照画像から顕著な特徴を捉えるポジティブ埋め込み($S^{p}_{*}$)と、欠陥を是正し、誤った特徴の回避を誘導するネガティブ埋め込み($S^{n}_{*}$)。
- 拡散モデルの完全な微調整を避けるために、テキストエンコーダーおよびU-Net内のプロンプト埋め込みのみを微調整する。これにより、効率性と一般化性能を維持する。
- ポジティブ埋め込みは、キービジュアル属性を強調することで多様な生成を促進する。一方、ネガティブ埋め込みはポジティブ信号からの誤りを内省・是正し、より高い耐障害性を実現する。
- 推論時に分類器フリー・ガイドランスを用いることで、学習済みの擬似語と新しい記述を組み合わせたテキストプロンプトによる柔軟な制御が可能になる。
- 複数の学習済み擬似語を組み合わせることで、コンセプトの組み合わせとプロンプト誘導型編集を可能にする。各擬似語には独自のポジティブおよびネガティブ埋め込みが付随する。
- LDM などの事前学習済み拡散モデルと互換性があり、アーキテクチャの変更なしに標準的なテキスト-to-画像生成パイプラインで動作する。
実験結果
リサーチクエスチョン
- RQ11枚の参照画像に基づくテキスト-to-画像生成手法は、過学習を回避しつつ、高い多様性と制御性を達成できるか?
- RQ2二重埋め込み(ポジティブ・ネガティブ)プロンプトチューニング戦略は、単一埋め込み手法と比較して、生成品質をどのように向上させるか?
- RQ3学習済み擬似語は、組み合わせや編集タスクを含む、複雑なテキスト誘導型画像生成にどの程度対応できるか?
- RQ4生成画像は実際の画像と比較してどれほど現実的であり、人間によるタービングテストに合格できるか?
- RQ5参照画像とプロンプトの間に矛盾する記述がある場合やドメインシフトが生じた場合でも、この手法は一般化性能を示せるか?
主な発見
- DreamArtist++ はタービングテストで34.5%の失敗率を示し、30%の閾値を著しく上回った。これは、生成画像が非常に現実的で、人間には本物と区別がつかないことを示している。
- 人間評価では、83.13%の参加者がDreamArtistが生成したアニメ画像をTextual Inversionの結果よりも好むと回答し、芸術的分野における優れた視覚的品質を示した。
- 複数のベンチマーク(ゼロショットおよびフェイシュット設定を含む)において、画像類似度、多様性、制御性の面で、既存の手法を上回った。
- DreamArtist++ は、ロボットボディに古代画のスタイルを組み合わせるなど、複雑なプロンプトに対しても多様な画像を生成でき、参照画像と矛盾する場合でも成功した。
- プロンプト誘導型画像編集において、生成された部分が元の文脈に自然に統合され、オリジナルのLDM機能と同等の性能を示した。
- 複数の学習済み擬似語を組み合わせたコンセプトの組み合わせにおいても、強力な一般化性能を示し、オブジェクト・スタイルやスタイル・スタイルの組み合わせなど、一貫性のある画像を生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。