Skip to main content
QUICK REVIEW

[논문 리뷰] Grounded Text-to-Image Synthesis with Attention Refocusing

Quynh Phung, Songwei Ge|arXiv (Cornell University)|2023. 06. 08.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

이 논문은 레이아웃 유도 손실을 사용하여 교차 및 자기 어텐션 레이어를 정규화함으로써 텍스트-이미지 합성의 제어 가능성과 정확성을 향상시키기 위한 훈련 없이 작동하는 어텐션 재집중 방법을 제안한다. GPT-4를 활용해 공간 레이아웃을 생성하고, 새로운 SAR 및 R or SAR 손실을 적용함으로써 복잡한 프롬프트에 대한 정렬 성능을 크게 향상시켰다—예를 들어 공간 관계나 객체 수를 다루는 벤치마크 과제에서 최대 10%의 정확도 향상을 달성하였다.

ABSTRACT

Driven by the scalable diffusion models trained on large-scale datasets, text-to-image synthesis methods have shown compelling results. However, these models still fail to precisely follow the text prompt involving multiple objects, attributes, or spatial compositions. In this paper, we reveal the potential causes in the diffusion model's cross-attention and self-attention layers. We propose two novel losses to refocus attention maps according to a given spatial layout during sampling. Creating the layouts manually requires additional effort and can be tedious. Therefore, we explore using large language models (LLM) to produce these layouts for our method. We conduct extensive experiments on the DrawBench, HRS, and TIFA benchmarks to evaluate our proposed method. We show that our proposed attention refocusing effectively improves the controllability of existing approaches.

연구 동기 및 목표

  • 복잡한 프롬프트(다수의 객체, 속성, 공간 관계 포함)를 다룰 때 텍스트-이미지 확산 모델에서 발생하는 뚜렷한 정렬 부족 문제를 해결하기 위해.
  • 교차 및 자기 어텐션 레이어의 어텐션 오류 정렬이 객체 혼합, 엔티티 누락, 속성 혼동의 근본 원인임을 규명하기 위해.
  • 기본 텍스트-이미지 모델을 미세조정 없이도 적용 가능한 모델에 종속되지 않는 훈련 없이 작동하는 방법을 개발하여, 명시적인 공간 레이아웃을 활용해 어텐션 맵을 재집중함으로써 제어 가능성을 향상시키기 위해.
  • GPT-4와 같은 대규모 언어 모델이 자연어 프롬프트에서 정확하고 구조화된 공간 레이아웃을 생성할 수 있는지 탐색하기 위해.
  • 기반 텍스트-이미지 생성 모델과 함께 대화형 언어 기반 이미지 수정을 가능하게 하기 위해.

제안 방법

  • 교차 및 자기 어텐션 레이어에서 추론 중 어텐션 맵을 개선하기 위해 새로운 두 가지 손실—SAR(Spatial Attention Regularization) 및 R or SAR(Refocusing with Object-level Regularization)—를 제안한다.
  • 예를 들어 레이블가 있는 바운딩 박스를 포함한 공간 레이아웃을 사용해 어텐션을 정확한 영역으로 유도함으로써 유사한 외관을 가진 객체들 간의 혼동을 줄인다.
  • GPT-4를 사용해 문맥 학습과 프롬프트 엔지니어링을 적용하여 자연어 프롬프트에서 구조적이고 유효한 레이아웃 표현을 생성한다.
  • 두 단계 파이프라인을 적용한다: 첫 번째 단계에서 LLM을 통해 레이아웃을 생성하고, 두 번째 단계에서 GLIGEN 또는 ControlNet과 같은 기반 확산 모델을 사용해 이미지를 합성한다.
  • 기본 텍스트-이미지 모델의 미세조정 없이도 추론 시점에 손실를 적용함으로써 모델에 종속되지 않는 호환성을 확보한다.
  • LLM을 통해 레이아웃를 수정하는 프롬프트를 제공함으로써 반복적인 이미지 편집을 가능하게 한다.

실험 결과

연구 질문

  • RQ1교차 및 자기 어텐션 레이어의 어텐션 오류 정렬이 다수 객체와 속성이 포함된 텍스트-이미지 생성 실패의 원인일 수 있는가?
  • RQ2레이아웃 유도 손실이 어텐션을 재집중하여 객체 혼동을 줄이고 프롬프트 정렬을 향상시키는 데 효과적인가?
  • RQ3GPT-4와 같은 대규모 언어 모델이 자연어 프롬프트에서 정확하고 유효한 공간 레이아웃을 생성하여 기반 이미지 합성에 활용할 수 있는가?
  • RQ4LLM이 생성한 레이아웃과 어텐션 재집중 손실을 조합한 방법이 복잡한 벤치마크에서 기준 모델보다 우수한 성능을 보이는가?
  • RQ5이 프레임워크는 반복적인 레이아웃 개선을 통해 대화형 언어 기반 이미지 편집을 지원할 수 있는가?

주요 결과

  • GLIGEN에 SAR 및 R or SAR 손실를 적용함으로써 TIFA 벤치마크에서 성능이 최대 10% 향상되었으며, 공간 관계 정확도는 6% 향상되었다.
  • DrawBench, HRS, TIFA 벤치마크 전반에서 강력한 기준 모델보다 일관되게 성능 향상을 보이며, 복잡한 프롬프트에 대한 강건성을 입증하였다.
  • GPT-4는 HRS 벤치마크에서 형식 정확도 98.5%, 유효성 98.5%, 정확도 88.5%를 기록하여 Llama 1, Llama 2, GPT-3를 모두 능가하였다.
  • GPT-4와 어텐션 재집중을 결합한 두 단계 파이프라인은 단일 단계의 Stable Diffusion보다 프롬프트 이해력과 객체 관계 정렬에서 뛰어난 성능을 보였다.
  • 실패 사례는 주로 많은 객체를 포함하거나 분포 이탈로 인해 레이아웃-이미지 정렬이 깨질 때 발생하며, 특히 객체 수 계산과 크기 추정에서 두드러진다.
  • 프레임워크는 LLM 프롬프트를 통해 대화형 이미지 편집을 가능하게 하여 사용자가 자연어 지시어를 통해 반복적으로 이미지를 개선할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.