Skip to main content
QUICK REVIEW

[논문 리뷰] Stable Diffusion is Unstable

Chengbin Du, Yanxi Li|arXiv (Cornell University)|2023. 06. 05.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

이 논문은 스탠더드 디퓨전에 대해 효과적인 화이트박스 공격을 가능하게 하는 기울기 기반, 미분 가능한 방법인 텍스트-이미지 모델을 대상으로 한 자동 공격(ATM)을 제안한다. ATM은 단어 교체 또는 확장을 위한 구름벨 소프트맥스 분포를 학습하여 악성 텍스트 프롬프트를 생성하며, 깨끗한 프롬프트와 높은 의미 유사도를 유지하면서도 효율적인 공격을 가능하게 한다. 이는 짧은 텍스트 공격에서 91.1%의 성공률, 긴 텍스트 공격에서 81.2%의 성공률을 기록하며, 텍스트-이미지 모델의 네 가지 핵심 취약 패턴을 드러낸다.

ABSTRACT

Recently, text-to-image models have been thriving. Despite their powerful generative capacity, our research has uncovered a lack of robustness in this generation process. Specifically, the introduction of small perturbations to the text prompts can result in the blending of primary subjects with other categories or their complete disappearance in the generated images. In this paper, we propose Auto-attack on Text-to-image Models (ATM), a gradient-based approach, to effectively and efficiently generate such perturbations. By learning a Gumbel Softmax distribution, we can make the discrete process of word replacement or extension continuous, thus ensuring the differentiability of the perturbation generation. Once the distribution is learned, ATM can sample multiple attack samples simultaneously. These attack samples can prevent the generative model from generating the desired subjects without compromising image quality. ATM has achieved a 91.1% success rate in short-text attacks and an 81.2% success rate in long-text attacks. Further empirical analysis revealed four attack patterns based on: 1) the variability in generation speed, 2) the similarity of coarse-grained characteristics, 3) the polysemy of words, and 4) the positioning of words.

연구 동기 및 목표

  • 작은 프롬프트 변형이 주제의 사라짐이나 잘못된 생성을 유도하는 텍스트-이미지 생성의 취약성 부족 문제를 해결하기 위해.
  • 취약성 탐색을 위한 수동적이고 정성적인 프롬프트 설계의 한계를 극복하기 위해 자동화되고 데이터 기반의 공격 생성을 가능하게 하기 위해.
  • 모델의 불안정성 탐색을 위해 고유의 의미 유사도를 유지하면서도 효과적인 악성 프롬프트를 생성할 수 있는 학습 가능한, 미분 가능한 방법을 개발하기 위해.
  • 공격 행동의 경험적 분 析를 통해 텍스트-이미지 모델의 체계적인 실패 패턴을 규명하기 위해.

제안 방법

  • ATM는 온도 감쇠를 적용한 구름벨 소프트맥스를 사용하여 이산적인 단어 교체 또는 확장을 미분 가능한 방식으로 부드럽게 처리함으로써, 프롬프트 변형에 대한 기울기 기반 최적화를 가능하게 한다.
  • 이진 마스크를 통해 목표 명사만 유지하면서 다른 단어에 대한 수정을 允허함으로써, 원하는 주제가 의미적으로 锚정되도록 보장한다.
  • 생성된 이미지의 잘못 분류를 최대화하기 위해 CLIP 분류기와 마진 손실을 사용하여 프롬프트 임베딩을 최적화한다.
  • 유창성과 의미 유사도 제약 조건은 자동 회귀 언어 모델링과 BERTScore 기반 정규화를 통해 적용되어 프롬프트 품질과 일관성을 유지한다.
  • 공격은 스탠더드 디퓨전에서 화이트박스 설정으로 훈련되어 DALL·E 2 및 미드저니와 같은 다른 모델로의 전이 가능성을 확보한다.
  • 훈련 후 다중 공격 프롬프트를 동시에 샘플링하여 악성 변형 공간의 효율적 탐색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1작은, 타겟된 프롬프트 변형에 노출되었을 때 텍스트-이미지 모델의 핵심 실패 패턴은 무엇인가?
  • RQ2어떻게 하면 텍스트-이미지 모델에 대한 화이트박스 공격을 위해 악성 프롬프트 생성을 미분 가능하고 효율적으로 만들 수 있는가?
  • RQ3한 모델(예: 스탠더드 디퓨전)에 대해 생성된 공격 프롬프트가 DALL·E 2나 미드저니와 같은 다른 모델로 얼마나 잘 전이되는가?
  • RQ4유창성과 의미 유사도 제약 조건은 악성 프롬프트의 성공률과 품질에 어떤 영향을 미치는가?
  • RQ5어떤 주요 취약점이 어텐션 메커니즘 또는 프롬프트 처리 과정에서 주제 무시나 잘못된 생성을 유도하는가?

주요 결과

  • ATM는 짧은 텍스트 프롬프트 공격에서 91.1%의 성공률, 긴 텍스트 프롬프트 공격에서 81.2%의 성공률를 기록하여 높은 효과성을 입증하였다.
  • 유창성과 의미 유사도 제약 조건을 포함함으로써 텍스트 유사도(TS)가 0.84로 향상되었고, 높은 공격 성공률 81.2%를 유지하였다.
  • 이 방법은 블랙박스 설정으로도 성공적으로 전이되었으며, DALL·E 2와 미드저니에 대해 고품질이고 의미적으로 일관된 프롬프트로 효과적인 공격을 수행하였다.
  • 제거 실험 결과, 유창성과 의미 유사도 제약 조건을 병행 적용할 경우 유사도와 성공률 사이의 최적의 트레이드오���을 달성하였으며, 개별 제약 조건보다 우수한 성능을 보였다.
  • 네 가지의 명백한 공격 패턴이 규명되었으며, 생성 속도의 변동성, 근본적인 특성의 유사성, 단어의 다의어성, 단어의 위치 민감성 등이 포함된다.
  • 이 방법은 다양한 샘플러 간에 전이 가능성을 보였으며, DDIM에서는 81.2%의 성공률, 더 강력한 DPM-Solver 샘플러에서는 76.5%의 성공률를 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.