Skip to main content
QUICK REVIEW

[논문 리뷰] Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion Models

Hila Chefer, Yuval Alaluf|arXiv (Cornell University)|2023. 01. 31.
Aesthetic Perception and Analysis인용 수 7
한 줄 요약

이 논문은 추론 시점에서 작동하는 Attend-and-Excite를 제안하며, 텍스트-이미지 확산 모델의 성능을 향상시키기 위해 입력 프롬프트에 포함된 모든 주제 토큰을 교차 attention 메커니즘이 집중하도록 이끌어, 치명적 忽略를 감소시키고 속성 유대를 향상시킨다. 노이즈 제거 과정 중에 자극 기반으로 attention 맵을 개선함으로써 재학습 없이도 의미적 충실도를 높이며, 복잡한 프롬프트를 완전히 반영하는 이미지를 생성하는 데 기존 기준 모델보다 뚜렷하게 뛰어나다.

ABSTRACT

Recent text-to-image generative models have demonstrated an unparalleled ability to generate diverse and creative imagery guided by a target text prompt. While revolutionary, current state-of-the-art diffusion models may still fail in generating images that fully convey the semantics in the given text prompt. We analyze the publicly available Stable Diffusion model and assess the existence of catastrophic neglect, where the model fails to generate one or more of the subjects from the input prompt. Moreover, we find that in some cases the model also fails to correctly bind attributes (e.g., colors) to their corresponding subjects. To help mitigate these failure cases, we introduce the concept of Generative Semantic Nursing (GSN), where we seek to intervene in the generative process on the fly during inference time to improve the faithfulness of the generated images. Using an attention-based formulation of GSN, dubbed Attend-and-Excite, we guide the model to refine the cross-attention units to attend to all subject tokens in the text prompt and strengthen - or excite - their activations, encouraging the model to generate all subjects described in the text prompt. We compare our approach to alternative approaches and demonstrate that it conveys the desired concepts more faithfully across a range of text prompts.

연구 동기 및 목표

  • 텍스트-이미지 확산 모델에서 의미적 충실도 문제, 특히 치명적 忽略와 잘못된 속성 유대를 해결하기 위해.
  • Stable Diffusion과 같은 최신 모델에서 주제나 속성이 누락되거나 잘못 할당되는 실패 모드를 규명하기 위해.
  • 학습이 필요 없고, 이미지 생성 중에 실시간으로 작동하는 방법을 개발하여 주제 토큰에 대한 주의를 향상시키기 위해.
  • 사전 훈련된 모델을 미세조정하지 않고도, 다중 주제를 포함한 복잡한 프롬프트에 대해 생성된 이미지의 충실도를 향상시키기 위해.
  • 치명적 忽略를 완화함으로써 공유된 의미적 표현을 통해 속성 유대가 암묵적으로 향상됨을 보여주기 위해.

제안 방법

  • 이미지 생성 중 실시간 의미 간섭을 위한 프레임워크인 생성적 의미 간호(GSN)를 도입한다.
  • 주제 토큰에 대한 교차 attention 활성화를 식별하고 강화하는 attention 기반 GSN 방법인 Attend-and-Excite를 설계한다.
  • 각 노이즈 제거 단계에서 잠재 특징을 수정하여 이미지 패치가 텍스트 프롬프트에 포함된 모든 주제 토큰을 주의하도록 유도한다.
  • 각 주제 토큰당 학습 가능한 자극 벡터를 사용하여 교차 attention 레이어의 attention 가중치를 증폭한다.
  • 모델의 사전 훈련된 가중치와 의미를 유지하면서 추론 전용으로 방법을 적용한다.
  • 사전 훈련된 텍스트 인코더의 주제와 속성 간 의미적 연결을 활용하여 암묵적으로 속성 유대를 향상시킨다.

실험 결과

연구 질문

  • RQ1추론 시 모든 주제 토큰에 대한 주의를 향상시킴으로써 텍스트-이미지 확산 모델에서 치명적 忽略를 줄일 수 있는가?
  • RQ2주제 토큰에 대한 주의를 향상시키는 것이, 명시적 지도 없이도 더 나은 속성 유대를 이끌어내는가?
  • RQ3모델의 미세조정 없이도 의미적 충실도를 향상시킬 수 있는가?
  • RQ4Attend-and-Excite는 Composable Diffusion나 StructureDiffusion와 같은 대안적 방법과 비교해 다중 객체 시나리오를 생성하는 데 얼마나 효과적인가?
  • RQ5자극 메커니즘이 다양한 프롬프트에서 주제 존재성과 속성 할당의 일관성을 어느 정도 향상시키는가?

주요 결과

  • Attend-and-Excite는 치명적 忽略를 크게 감소시켜 프롬프트에 포함된 모든 주제 토큰이 생성된 이미지에 명확히 표현되도록 보장한다.
  • 메커니즘이 암묵적으로 속성 유대를 향상시켜, 색상과 묘사어가 올바른 주제에 정확히 할당됨을 입증한다.
  • 정성적 비교에서 Attend-and-Excite는 복잡한 프롬프트에 다수의 주제가 포함된 경우, Stable Diffusion와 Composable Diffusion를 모두 능가하는 의미적 충실도를 갖춘 이미지를 생성한다.
  • 시각적 검토를 통해 다양한 프롬프트에서 높은 이미지 품질을 유지하면서도 입력 프롬프트와의 일치도가 향상됨을 확인하였다.
  • 이 방법은 다수의 물체, 속성, 공간 관계를 포함한 다양한 유형의 프롬프트에서 효과적이다.
  • Attend-and-Excite는 모델의 미세조정 없이도 추론 시점의 attention 조절에 의존하여 이러한 결과를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.