Skip to main content
QUICK REVIEW

[論文レビュー] Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion Models

Hila Chefer, Yuval Alaluf|arXiv (Cornell University)|Jan 31, 2023
Aesthetic Perception and Analysis被引用数 7
ひとこと要約

本稿では、推論時における方法 Attend-and-Excite を提案する。この手法は、テキストから画像への拡散モデルにおけるクロスアテンション機構を、入力プロンプト内のすべての主題トークンに注目させるように誘導することで、深刻な無視(catastrophic neglect)を軽減し、属性の束縛を向上させる。ノイズ除去の過程でアテンションマップを励起に基づいて精錬することで、再トレーニングを必要とせず、複雑なプロンプトを完全に反映した画像生成において、ベースラインモデルを顕著に上回る性能を達成する。

ABSTRACT

Recent text-to-image generative models have demonstrated an unparalleled ability to generate diverse and creative imagery guided by a target text prompt. While revolutionary, current state-of-the-art diffusion models may still fail in generating images that fully convey the semantics in the given text prompt. We analyze the publicly available Stable Diffusion model and assess the existence of catastrophic neglect, where the model fails to generate one or more of the subjects from the input prompt. Moreover, we find that in some cases the model also fails to correctly bind attributes (e.g., colors) to their corresponding subjects. To help mitigate these failure cases, we introduce the concept of Generative Semantic Nursing (GSN), where we seek to intervene in the generative process on the fly during inference time to improve the faithfulness of the generated images. Using an attention-based formulation of GSN, dubbed Attend-and-Excite, we guide the model to refine the cross-attention units to attend to all subject tokens in the text prompt and strengthen - or excite - their activations, encouraging the model to generate all subjects described in the text prompt. We compare our approach to alternative approaches and demonstrate that it conveys the desired concepts more faithfully across a range of text prompts.

研究の動機と目的

  • テキストから画像への拡散モデルにおける意味的忠実度の問題、特に深刻な無視と誤った属性束縛を解決すること。
  • Stable Diffusion らのような最先端モデルが、主題や属性を省略または誤って割り当てる失敗モードを同定すること。
  • 事前学習済みモデルの微調整を必要とせず、画像生成中に即座に適用可能な干渉手法として、すべての主題トークンへの注目を強化すること。
  • 事前学習済みモデルの微調整なしに、複数の主題を含む複雑なプロンプトに対する生成画像の忠実度を向上させること。
  • 深刻な無視の軽減が、共有される意味的表現を通じて、属性束縛を間接的に改善することを示すこと。

提案手法

  • 推論中に即座に意味的干渉を施すためのフレームワークとして、生成的意味的ナースイング(Generative Semantic Nursing, GSN)を導入する。
  • 主題トークンの識別と強化を目的とした、アテンションに基づく GSN メソッドとして Attend-and-Excite を設計する。
  • 各ノイズ除去ステップで、画像パッチがプロンプト内のすべての主題トークンに注目するように、潜在特徴を変更する。
  • 各主題トークンごとに学習可能な励起ベクトルを用いて、クロスアテンション層におけるアテンション重みを強化する。
  • 推論時のみにこの手法を適用し、事前学習済みモデルの重みと意味的特性をそのままで保持する。
  • 事前学習済みテキストエンコーダーの意味的連結性を活用し、属性束縛の改善を間接的に実現する。

実験結果

リサーチクエスチョン

  • RQ1推論時にすべての主題トークンへの注目を高めることで、テキストから画像への拡散モデルにおける深刻な無視を軽減できるか?
  • RQ2主題トークンへの注目を向上させることで、明示的な監視なしに属性束縛の質も向上するのか?
  • RQ3生成モデルの微調整や再学習なしに、意味的忠実度を向上させられるか?
  • RQ4Composable Diffusion や StructureDiffusion などの代替手法と比較して、Attend-and-Excite は複雑な複数オブジェクトシーンの生成においてどのように性能を発揮するか?
  • RQ5励起機構は、多様なプロンプトにおいて、主題の存在と属性の割り当ての整合性をどの程度向上させるか?

主な発見

  • Attend-and-Excite は深刻な無視を顕著に軽減し、プロンプトに含まれるすべての主題トークンが生成画像に視覚的に表現されることを保証する。
  • 本手法は、色や記述子が意図した主題に正しく割り当てられるなど、属性束縛を間接的に改善する。
  • 定性的な比較において、Attend-and-Excite は Stable Diffusion や Composable Diffusion を上回り、複数の主題を含む複雑なプロンプトの生成において特に優れた意味的忠実度を達成する。
  • 視覚的検査により確認されたように、本手法は高い画像品質を維持しつつ、入力プロンプトとの整合性をより良く実現する。
  • 本手法は、複数のオブジェクト、属性、空間的関係を含むさまざまなプロンプトタイプにおいて有効である。
  • 本手法は、モデルの微調整を一切行わず、推論時のアテンションマッピングの調整に依存するだけで、これらの成果を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。