Skip to main content
QUICK REVIEW

[논문 리뷰] Harnessing the Spatial-Temporal Attention of Diffusion Models for High-Fidelity Text-to-Image Synthesis

Qiucheng Wu, Yujian Liu|arXiv (Cornell University)|2023. 04. 07.
Computer Graphics and Visualization Techniques인용 수 4
한 줄 요약

이 논문은 공간-시간 cross-attention를 명시적으로 제어함으로써 생성 품질을 향상시키는 새로운 텍스트-이미지 확산 모델을 제안한다. 객체 영역을 정의하기 위해 레이아웃 예측기를 사용하고, 노이즈 제거 단계 동안 전역 및 국소 텍스트 어텐션의 균형을 동적으로 조정할 수 있는 학습 가능한 어텐션 최적화기를 도입하여, 미세조정 없이도 복잡한 텍스트 기술서와의 정확한 일치를 달성한다.

ABSTRACT

Diffusion-based models have achieved state-of-the-art performance on text-to-image synthesis tasks. However, one critical limitation of these models is the low fidelity of generated images with respect to the text description, such as missing objects, mismatched attributes, and mislocated objects. One key reason for such inconsistencies is the inaccurate cross-attention to text in both the spatial dimension, which controls at what pixel region an object should appear, and the temporal dimension, which controls how different levels of details are added through the denoising steps. In this paper, we propose a new text-to-image algorithm that adds explicit control over spatial-temporal cross-attention in diffusion models. We first utilize a layout predictor to predict the pixel regions for objects mentioned in the text. We then impose spatial attention control by combining the attention over the entire text description and that over the local description of the particular object in the corresponding pixel region of that object. The temporal attention control is further added by allowing the combination weights to change at each denoising step, and the combination weights are optimized to ensure high fidelity between the image and the text. Experiments show that our method generates images with higher fidelity compared to diffusion-model-based baselines without fine-tuning the diffusion model. Our code is publicly available at https://github.com/UCSB-NLP-Chang/Diffusion-SpaceTime-Attn.

연구 동기 및 목표

  • 텍스트-이미지 확산 모델에서 낮은 이미지 품질 문제, 특히 누락된 객체, 일치하지 않는 속성, 잘못된 위치에 있는 객체를 해결하기 위해.
  • 공간(픽셀 위치) 및 시간(노이즈 제거 단계) 차원에서의 교차 어텐션 정확도를 향상시키기 위해.
  • 미세조정 없이도 복잡하거나 희귀한 텍스트 기술서에 대해 고품질의 이미지 생성을 가능하게 하기 위해.
  • 이미지 생성 과정에서 공간과 시간에 걸쳐 어텐션 동역학을 명시적이고 학습 가능한 방식으로 제어할 수 있도록 하기 위해.

제안 방법

  • 레이아웃 예측기가 텍스트에 언급된 각 객체에 대한 공간적 영역을 생성하며, 이는 기술서 또는 사용자 입력에서 유래한다.
  • 예측된 객체 영역 내에서 전역 텍스트 어텐션과 국소 객체 전용 어텐션을 조합하여 공간 어텐션을 재가중한다.
  • 노이즈 제거 단계에 걸쳐 어텐션 조합 가중치가 변화하도록 시간 어텐션 제어를 구현한다.
  • 이미지-텍스트 일치도를 극대화하기 위해 CLIP 기반 목적함수를 사용하여 어텐션 가중치를 종단 간 최적화한다.
  • 사전 훈련된 확산 모델의 가중치를 유지하면서도 인퍼런스 단계에서 작동하는 플러그인 모듈로 운영된다.
  • 최적화 과정은 인간의 그림 그리기 과정을 모방한다: 먼저 전반적인 레이아웃을 그리고, 이후 점진적으로 세부 사항을 보완한다.

실험 결과

연구 질문

  • RQ1텍스트-이미지 확산 모델에서 교차 어텐션에 대한 명시적 공간-시간 제어가 이미지 품질 향상에 기여하는가?
  • RQ2노이즈 제거 단계에 걸쳐 동적으로 변화하는 어텐션 가중치는 객체 정렬과 속성 일관성에 어떤 영향을 미치는가?
  • RQ3이 방법은 확산 모델의 미세조정 없이도 희귀하거나 복잡한 텍스트 기술서에 일반화 가능한가?
  • RQ4전역 및 국소 텍스트 어텐션의 조합이 객체 복귀율과 공간 관계 정확도를 향상시키는가?

주요 결과

  • 희귀한 객체 조합, 속성, 공간 관계를 포함한 합성 데이터셋에서, 이 방법은 42.4%의 객체 복귀율과 59.6%의 공간 관계 정밀도를 달성하여 모든 베이스라인을 압도했다.
  • Stable Diffusion 및 기타 베이스라인에서 흔히 발생하는 실패 유형들 — 예를 들어 누락된 객체, 잘못된 위치에 있는 객체, 속성 불일치 — 를 효과적으로 해결했다.
  • 주관적 평가 결과, 67.1%의 작업자들이 제안된 방법으로 생성된 이미지가 베이스라인 대비 종합적인 품질과 품질에서 선호되었다.
  • 객체 중심 예측 정확도가 성능에 영향을 미치며, 이미지 가장자리에 국한된 예측은 객체 누락을 유발한다.
  • 예측된 객체 영역을 이미지 가장자리에서 내측으로 이동시킴으로써 실패 케이스를 해결할 수 있었으며, 이는 공간적 정렬 품질이 핵심임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.