Skip to main content
QUICK REVIEW

[논문 리뷰] What the DAAM: Interpreting Stable Diffusion Using Cross Attention

Raphael Tang, Linqing Liu|arXiv (Cornell University)|2022. 10. 10.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 텍스트-이미지 확산 모델에 대해 픽셀 수준의 기여도 맵을 생성하기 위한 DAAM(Diffusion Attentive Attribution Maps)을 소개한다. 이는 복원 U-Net에서의 교차 어텐션 점수를 집계하여 도출된다. DAAM은 단어가 이미지 영역에 미치는 영향을 해석 가능한 방식으로 분석할 수 있게 하며, 스테이블 디퓨전에서 문법적 매핑 패턴과 특징의 얽힘 현상을 드러낸다. 정량적 검증은 의미 분할과 인간 평가를 통해 수행된다.

ABSTRACT

Large-scale diffusion neural networks represent a substantial milestone in text-to-image generation, but they remain poorly understood, lacking interpretability analyses. In this paper, we perform a text-image attribution analysis on Stable Diffusion, a recently open-sourced model. To produce pixel-level attribution maps, we upscale and aggregate cross-attention word-pixel scores in the denoising subnetwork, naming our method DAAM. We evaluate its correctness by testing its semantic segmentation ability on nouns, as well as its generalized attribution quality on all parts of speech, rated by humans. We then apply DAAM to study the role of syntax in the pixel space, characterizing head--dependent heat map interaction patterns for ten common dependency relations. Finally, we study several semantic phenomena using DAAM, with a focus on feature entanglement, where we find that cohyponyms worsen generation quality and descriptive adjectives attend too broadly. To our knowledge, we are the first to interpret large diffusion models from a visuolinguistic perspective, which enables future lines of research. Our code is at https://github.com/castorini/daam.

연구 동기 및 목표

  • 텍스트 프롬프트의 개별 단어가 확산 모델에서 생성된 이미지의 특정 영역에 어떻게 영향을 미치는지 해석하기.
  • 스테이블 디퓨전의 교차 어텐션 특징에서 고해상도 픽셀 수준의 기여도 맵을 생성하는 방법 개발하기.
  • 의미 분할과 인간 주석을 통해 단어-픽셀 기여도의 정확성과 해석 가능성 평가하기.
  • 문법적 관계(예: 어근-의존어 관계)가 생성된 이미지 공간에서 시각적 어텐션 패턴으로 어떻게 매핑되는지 조사하기.
  • 특히 공하위어와 묘사 어미가 유도하는 특징 얽힘으로 인한 확산 모델의 실패 모드 분석하기.

제안 방법

  • DAAM는 스테이블 디퓨전의 복원 U-Net에서 유도된 교차 어텐션 점수를 업스케일링하고 집계하여 단어 수준의 기여도 맵을 계산한다.
  • 텍스트 토큰과 잠재 이미지 토큰 간의 멀티헤드 교차 어텐션 특징을 사용하여 각 단어별 히트맵을 생성한다.
  • DAAM 맵은 명사 기반 의미 분할 작업에서 평균 교차율(mIoU)을 통해 평가되며, 58.9–64.8 mIoU의 성능을 기록한다.
  • 모든 형태의 어절에 대해 평균 의견 점수(MOS)를 사용한 인간 평가가 수행되었으며, 점수 범위는 3.4에서 4.2로, 보통에서 양호한 해석 가능성 수준을 나타낸다.
  • 문법적 매핑은 10개의 의존 관계에서 헤드-의존 어텐션 맵 간 상호작용을 분석하여 연구되었으며, 방향성 불균형이 드러났다.
  • 특징 얽힘은 장면 레이아웃을 고정하고 어미를 변화시켜, 변화가 전체 이미지에 걸쳐 어떻게 전파되는지 관찰함으로써 연구되었다.

실험 결과

연구 질문

  • RQ1텍스트 프롬프트의 개별 단어는 생성된 이미지의 특정 영역에 어떻게 영향을 미치는가?
  • RQ2스테이블 디퓨전에서의 교차 어텐션 맵은 얼마나 정확하고 해석 가능한 픽셀 수준의 기여도를 제공하는가?
  • RQ3문법적 관계(예: 주어-서술어, 수식어-어근)는 생성된 이미지의 시각적 어텐션 패턴으로 어떻게 매핑되는가?
  • RQ4공하위어와 묘사 어미는 확산 모델 생성 과정에서 특징 얽힘을 유도하는 데 어떤 역할을 하는가?
  • RQ5DAAM는 텍스트-이미지 생성 과정에서 체계적인 편향이나 실패 모드(예: 관련 없는 이미지 영역에 과도하게 집중하는 것)를 드러낼 수 있는가?

주요 결과

  • DAAM는 생성된 이미지의 의미 분할 작업에서 평균 교차율(mIoU)이 58.9–64.8로 나타나, 어휘 어텐션과 참조 객체 영역 간 강력한 일치를 보였다.
  • 인간 평가 결과, 모든 어절 품사에서 평균 의견 점수(MOS)가 3.4–4.2로 나타나, DAAM 맵가 해석 가능하고 의미적으로 유의미하다는 평가를 받았다.
  • 일부 문법적 관계, 예를 들어 주어-서술어 관계에서는 서술어의 어텐션 맵이 주어의 어텐션 맵을 포함하는 경향을 보여, 서술어가 주어와 그 환경을 모두 맥락화함을 시사한다.
  • 공하위어 쌍(예: '기린과 기린')은 DAAM 맵에서 더 높은 겹침을 보이며 이미지 품질도 악화되는 경향을 보여, 공하위어성으로 인해 얽힘과 생성 실패가 발생함을 시사한다.
  • '녹색', '빨간색', '부스러운'과 같은 묘사 어미는 장면 레이아웃이 고정되어 있음에도 불구하고 전체 이미지에 걸쳐 어텐션 확산을 유도하며, 이는 광범위하고 국소화되지 않은 어텐션 패턴을 보여준다.
  • 통제 실험에서 '파란', '초록', '빨간' 등의 어미를 변경하면 배경 색상과 질감까지 변화함을 확인하여, 형용사 수식어가 전체 장면에 걸쳐 얽힘을 유도함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.