Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Attacks and Defenses on Text-to-Image Diffusion Models: A Survey

Chenyu Zhang, Mingwang Hu|arXiv (Cornell University)|2024. 07. 10.
Digital Media Forensic Detection인용 수 4
한 줄 요약

이 종합적 리뷰는 텍스트-이미지 확산 모델을 대상으로 한 적대적 공격 및 방어 기법에 대해 포괄적인 분석을 제공하며, 모델의 강건성과 안전성에 미치는 영향에 따라 공격 방법을 분류한다. 비정상적인 문장 구조나 미세한 노이즈에 민감한 핵심 취약점을 밝혀내고, 방어 전략을 평가하면서도 인식 불가능한 적대적 프롬프트에 대한 대응 부족과 적응형, 패턴 기반 방어의 필요성을 강조한다.

ABSTRACT

Recently, the text-to-image diffusion model has gained considerable attention from the community due to its exceptional image generation capability. A representative model, Stable Diffusion, amassed more than 10 million users within just two months of its release. This surge in popularity has facilitated studies on the robustness and safety of the model, leading to the proposal of various adversarial attack methods. Simultaneously, there has been a marked increase in research focused on defense methods to improve the robustness and safety of these models. In this survey, we provide a comprehensive review of the literature on adversarial attacks and defenses targeting text-to-image diffusion models. We begin with an overview of text-to-image diffusion models, followed by an introduction to a taxonomy of adversarial attacks and an in-depth review of existing attack methods. We then present a detailed analysis of current defense methods that improve model robustness and safety. Finally, we discuss ongoing challenges and explore promising future research directions. For a complete list of the adversarial attack and defense methods covered in this survey, please refer to our curated repository at https://github.com/datar001/Awesome-AD-on-T2IDM.

연구 동기 및 목표

  • 텍스트-이미지 확산 모델을 대상으로 한 적대적 공격을 체계적으로 검토하여 강건성과 안전성에 대한 취약점을 집중 분석한다.
  • 문법 오류, 미세한 노이즈, 의미적 변형을 악용하는 기존 공격 방법을 분석한다.
  • 외부 및 내부 방어 수단을 구분하여 안전성과 강건성에 대한 방어 메커니즘을 평가한다.
  • 기존 방어 수단의 주요 한계, 특히 인식 불가능한 적대적 프롬프트에 대한 무력화를 특정한다.
  • 향후 연구 방향을 제시하며, LLM 기반 다중 에이전트 프레임워크와 패턴 기반 방어 전략을 포함한다.

제안 방법

  • 모델의 강건성(예: 다중 객체 생성 실패)과 안전성(예: 콘텐츠 필터 회피)에 미치는 영향에 따라 적대적 공격의 분류 체계를 제안한다.
  • 프롬프트 수준의 변형, 예를 들어 노이즈 단어 추가, 철자 오류, 발음 유사어 교체 등을 포함한 공격 방법을 분류한다.
  • 모델 편집 기법을 통해 핵심 기능을 유지하면서도 적대적 프롬프트로 훈련된 CLIP 텍스트 인코더의 미세조정 전략을 검토한다.
  • 외부 방어(예: 프롬프트 탐지/수정)와 내부 방어(예: 악성 출력에 저항하도록 모델 파라미터 수정)를 평가한다.
  • 목표적 미세조정 또는 파라미터 편집을 통해 CLIP의 사전 훈련된 의미적 이해 능력을 유지하면서도 적대적 입력에 대응하도록 조정하는 데서 발생하는 상충 관계를 분석한다.
  • 발견된 적대적 프롬프트 패턴을 바탕으로 향후 보다 일반화 가능한 방어 메커니즘의 기초로 활용할 것을 제안한다.

실험 결과

연구 질문

  • RQ1텍스트-이미지 확산 모델에서 프롬프트의 강건성과 안전성과 관련된 주요 취약점은 무엇인가?
  • RQ2철자 오류, 노이즈 단어, 또는 LLM이 생성한 재작성 등 다양한 종류의 적대적 프롬프트 변형은 모델 출력에 어떻게 영향을 미치는가?
  • RQ3왜 현재의 방어 방법은 미세하고 문법적으로 잘못된 프롬프트를 포함한 무차별적 공격에 효과가 없는가?
  • RQ4적대적 프롬프트의 패턴 인식은 더 강건하고 일반화 가능한 방어 메커니즘을 가능하게 할 수 있는가?
  • RQ5LLM 기반 다중 에이전트 시스템은 매우 인식 불가능한 적대적 공격 프롬프트 생성을 자동화하는 데 어떤 역할을 할 수 있는가?

주요 결과

  • Stable Diffusion 및 유사 모델은 5자리의 임의 문자 삽입과 같은 미세한 프롬프트 변형에도 매우 민감하여 생성된 이미지의 내용이 극적으로 변화한다.
  • 기존의 방어 수단은 악성 키워드를 명시적으로 포함하지 않지만 여전히 해로운 출력을 생성하는 프롬프트에 대해 대부분 효과가 없으며, 특히 의미적 은폐 기법을 사용할 경우 더욱 그렇다.
  • 적대적 프롬프트로 CLIP 텍스트 인코더를 미세조정할 경우 기본적인 다중 모odal 이해 능력이 떨어질 위험이 있어, 파라미터 효율적인 편집 기법의 필요성이 강조된다.
  • 현재의 방어 메커니즘은 단어 수준의 변형과 LLM이 만든 적대적 프롬프트에 대해 성공률가 낮아, 적응형이고 일반화 가능한 보호 수단의 부족함을 보여준다.
  • 모델 편집 기법은 전체적인 미세조정 대비 유망한 대안을 제공하며, 악성 행동을 정밀하게 수정하면서도 핵심 모델 기능을 유지할 수 있다.
  • LLM 기반 다중 에이전트 시스템의 출현은 고도로 인식 불가능한 적대적 프롬프트 생성을 자동화하는 데 유의미한 길을 열어주며, 이에 대응하기 위해 고도의 방어 전략이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.