Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating the Robustness of Text-to-image Diffusion Models against Real-world Attacks

Hongcheng Gao, Hao Zhang|arXiv (Cornell University)|2023. 06. 16.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 안정된 확산 모델과 DALL-E 2와 같은 텍스트-이미지 확산 모델을 대상으로 하되, 실제 인간이 입력하는 방식과 유사한 편집 오류, 문자 대체, 발음 유사 오류 등의 편집을 가진 블랙박스 적대적 공격 프레임워크를 최초로 제안한다. 이는 의미 그대로의 의미 유지 조건 하에 수행되며, 분포 기반 공격 목표함수와 근사 최적화 기법을 활용하여 낮은 쿼리 수와 낮은 편집 비율로도 높은 성공률을 달성한다. 이는 Stable Diffusion 및 DALL-E 2와 같은 모델의 심각한 내구성 취약점을 드러낸다.

ABSTRACT

Text-to-image (T2I) diffusion models (DMs) have shown promise in generating high-quality images from textual descriptions. The real-world applications of these models require particular attention to their safety and fidelity, but this has not been sufficiently explored. One fundamental question is whether existing T2I DMs are robust against variations over input texts. To answer it, this work provides the first robustness evaluation of T2I DMs against real-world attacks. Unlike prior studies that focus on malicious attacks involving apocryphal alterations to the input texts, we consider an attack space spanned by realistic errors (e.g., typo, glyph, phonetic) that humans can make, to ensure semantic consistency. Given the inherent randomness of the generation process, we develop novel distribution-based attack objectives to mislead T2I DMs. We perform attacks in a black-box manner without any knowledge of the model. Extensive experiments demonstrate the effectiveness of our method for attacking popular T2I DMs and simultaneously reveal their non-trivial robustness issues. Moreover, we provide an in-depth analysis of our method to show that it is not designed to attack the text encoder in T2I DMs solely.

연구 동기 및 목표

  • 실제로 인간이 생성한 오류(예: 타이핑 실수, 문자 대체, 발음 유사 오류 등)가 의미를 유지하면서 텍스트-이미지 확산 모델의 내구성에 미치는 영향을 평가하는 것.
  • 모델 아키텍처나 가중치 정보를 알 필요 없이 작동하는 블랙박스 공격 방법을 개발하고, 편집된 입력의 의미 일관성을 중시하는 것.
  • 공격가가 주로 텍스트 인코더를 공격하는지, 아니면 확산 과정 자체에도 영향을 미치는지 조사하는 것.
  • 최소한의 편집과 쿼리로도 효과적인 분포 기반 공격 목표함수를 통해 이미지 생성을 오도하는 데 성공하는지 입증하는 것.

제안 방법

  • 생성 분포에 대한 영향을 미치는 키워드의 경계 영향도를 기반으로 하여, 고임팩트 키워드를 탐지하고 수정하는 데에 근사 최적화 기법을 사용하는 블랙박스 공격 프레임워크를 제안한다.
  • 기존의 분포 기반 공격 목표함수인 2ST 및 MMD 거리 측정법을 도입하여, 생성된 이미지가 원래 텍스트 기술과의 일치를 해칠 수 있도록 유도한다.
  • 실제적인 규칙에 따라 문자 수준의 편집을 적용한다: 타이핑 실수(레벤슈타인 거리 ≤3), 시각적으로 유사한 문자 대체, 동음이의어 또는 발음이 유사한 단어로의 대체.
  • 문장 길이를 제외한 진짜 쿼리 시간을 최소화하는 방식으로 쿼리 효율적인 최적화를 수행함으로써 도청 공격의 가능성을 높인다.
  • ChatGPT-GP, LAION-COCO, DiffusionDB, SBU Corpus 등 다양한 데이터셋에서 공격를 검증하였으며, 의미 일관성을 확보하기 위해 인간 평가를 실시하였다.
  • Stable Diffusion 및 DALL-E 2 등의 모델에서 공격 효과를 분석하여, 공격가가 텍스트 인코더뿐 아니라 확산 과정 자체에도 영향을 미친다는 것을 확인하였다.

실험 결과

연구 질문

  • RQ1실제로 인간이 입력하는 방식과 유사한 텍스트 편집(예: 타이핑 실수, 발음 오류 등)이 의미를 유지하면서 텍스트-이미지 확산 모델을 효과적으로 오도할 수 있는가?
  • RQ2블랙박스 제약 조건 하에서 분포 기반 공격 목표함수(예: 2ST, MMD)가 텍스트-이미지 유사도를 얼마나 효과적으로 낮출 수 있는가?
  • RQ3공격는 주로 텍스트 인코더를 공격하는가, 아니면 확산 과정 자체에도 영향을 미치는가?
  • RQ4실제 환경에서 높은 공격 성공률를 달성하기 위해 필요한 최소한의 편집 비율과 쿼리 수는 얼마인가?

주요 결과

  • 모든 데이터셋에서 텍스트-이미지 유사도(S_I2T)가 평균 4점 이상 감소하였으며, 인간 평가에서 성공률가 80% 이상을 기록하였다.
  • 평균적으로 진짜 쿼리 시간이 10회 이내로 소요되어, 높은 쿼리 효율성을 입증하였다.
  • 편집은 매우 미미하였으며, 타이핑 실수의 경우 레벤슈타인 거리 ≤3, 발음 오류의 경우 ≤6이었고, 이는 도청 공격의 가능성과도 부합하였다.
  • DALL-E 2 및 Stable Diffusion와 같은 모델들은 낮은 편집 비율에서도 높은 공격 성공률(80% 이상)을 보이며 뚜렷한 취약성을 보였다.
  • 인간 평가 점수는 70 이상을 유지하여 수정된 프롬프트가 의미적으로 일관되고 자연스럽다는 점을 확인하였다.
  • 공격는 텍스트 인코더뿐 아니라 확산 과정 자체에도 영향을 미치는 것으로 확인되어, 더 넓은 아키텍처적 취약성을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.