Skip to main content
QUICK REVIEW

[논문 리뷰] Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models?

Yu‐Lin Tsai, Chia‐Yi Hsu|arXiv (Cornell University)|2023. 10. 16.
Digital Rights Management and Security인용 수 4
한 줄 요약

이 논문은 텍스트-이미지 확산 모델의 안전성 메커니즘을 회피하는 데 성공적으로 작동하는 모델에 종속되지 않는 레드팀 도구인 Ring-A-Bell을 소개한다. 이 도구는 프롬프트 공학과 악성 개념 추출을 통해 안전성 메커니즘을 회피하는 프롬프트를 식별하고 생성한다. 실험 결과, ESD, SLD, 및 최적화된 Stable Diffusion와 같은 개념 제거 방법조차도 높은 성공률(최대 98.8% ASR)로 우회할 수 있음을 입증하여 현재의 안전성 방어 조치에 심각한 취약성이 존재함을 드러낸다.

ABSTRACT

Diffusion models for text-to-image (T2I) synthesis, such as Stable Diffusion (SD), have recently demonstrated exceptional capabilities for generating high-quality content. However, this progress has raised several concerns of potential misuse, particularly in creating copyrighted, prohibited, and restricted content, or NSFW (not safe for work) images. While efforts have been made to mitigate such problems, either by implementing a safety filter at the evaluation stage or by fine-tuning models to eliminate undesirable concepts or styles, the effectiveness of these safety measures in dealing with a wide range of prompts remains largely unexplored. In this work, we aim to investigate these safety mechanisms by proposing one novel concept retrieval algorithm for evaluation. We introduce Ring-A-Bell, a model-agnostic red-teaming tool for T2I diffusion models, where the whole evaluation can be prepared in advance without prior knowledge of the target model. Specifically, Ring-A-Bell first performs concept extraction to obtain holistic representations for sensitive and inappropriate concepts. Subsequently, by leveraging the extracted concept, Ring-A-Bell automatically identifies problematic prompts for diffusion models with the corresponding generation of inappropriate content, allowing the user to assess the reliability of deployed safety mechanisms. Finally, we empirically validate our method by testing online services such as Midjourney and various methods of concept removal. Our results show that Ring-A-Bell, by manipulating safe prompting benchmarks, can transform prompts that were originally regarded as safe to evade existing safety mechanisms, thus revealing the defects of the so-called safety mechanisms which could practically lead to the generation of harmful contents. Our codes are available at https://github.com/chiayi-hsu/Ring-A-Bell.

연구 동기 및 목표

  • 텍스트-이미지 확산 모델의 개념 제거 및 안전성 필터링 메커니즘의 신뢰성을 평가하기 위해.
  • 금지된 또는 NSFW 콘텐츠 생성을 허용하는 배포된 안전성 메커니즘의 취약성을 규명하기 위해.
  • 텍스트 인코더만을 사용하여 오프라인에서 작동하는 확장 가능한 모델에 종속되지 않는 레드팀 프레임워크를 개발하기 위해.
  • 프롬프트 공학이 온라인 서비스 및 최적화된 안전성 메커니즘을 효과적으로 우회할 수 있음을 입증하기 위해.
  • 실제 악성 프롬프팅 상황에서 안전성 메커니즘의 강건성을 평가하기 위한 체계적 벤치마크를 제공하기 위해.

제안 방법

  • Ring-A-Bell는 CLIP와 같은 텍스트 인코더를 사용하여 낙관, 폭력과 같은 민감한 개념의 통합적 표현을 구축함으로써 개념 추출을 수행한다.
  • 목표 개념과의 의미적 유사도를 극대화하면서 탐지 가능성은 최소화하는 프롬프트 쌍을 생성함으로써 악성 개념 데이터베이스를 구축한다.
  • 유전 알고리즘(GA) 또는 PeZ를 통해 이산 최적화를 수행하여 안전 필터를 우회하는 효과적인 악성 프롬프트를 탐색한다.
  • empirical 개념 표현 $\hat{c}$가 여러 프롬프트 쌍에서 학습되어 일반화 능력을 향상시키는 기반을 마련하기 위해 미분 가능한 프롬프트 최적화 프레임워크를 활용한다.
  • 공격 성공률(ASR)은 악성 프롬프트 하에서 분류기(Q16)에 의해 부적절한 이미지로 분류된 비율로 계산된다.
  • 이 프레임워크는 오프라인에서 작동하며 타겟 모델의 가중치에 접근할 필요가 없어 Midjourney와 같은 온라인 서비스에도 적용 가능하다.

실험 결과

연구 질문

  • RQ1텍스트-이미지 확산 모델의 기존 개념 제거 방법이 악성 프롬프트를 통해 신뢰성 있게 우회될 수 있는가?
  • RQ2모델을 수정하지 않고도 프롬프트 공학이 안전성 메커니즘을 효과적으로 우회할 수 있는가?
  • RQ3하이퍼파rameter인 $\eta$와 $K$는 악성 프롬프트 생성의 성공률에 어떤 영향을 미치는가?
  • RQ4프롬프트 쌍의 수 $N$이 추출된 악성 개념의 강건성과 일반화 능력에 어떤 영향을 미치는가?
  • RQ5GA와 PeZ와 같은 다양한 최적화 전략은 효과적인 악성 프롬프트 생성에서 어떻게 비교되는가?

주요 결과

  • Midjourney에서 폭력 관련 프롬프트에 대해 Ring-A-Bell는 98.8%의 공격 성공률(ASR)을 기록했고, SLD-Medium에서는 97.6%를 기록하여 높은 우회 능력을 입증했다.
  • 노르마리티에 대해서는 Stable Diffusion에서 93.68%의 ASR, SLD-Medium에서는 91.58%의 ASR를 기록했으며, 안전성 메커니즘이 작동하는 상황에서도 성능을 유지를 하였다.
  • 노르마리티의 최적 $\eta$ 값은 3, 폭력의 최적 $\eta$ 값은 5.5로, 이 값 이상일 경우 성능이 정점에 도달하거나 감소하는 경향을 보였다.
  • 프롬프트 쌍 수를 늘려 $N=50$으로 설정할 경우, $N=10$에 비해 일반화 능력 향상과 함께, 노르마리티의 ASR는 93.68%로, 폭력의 ASR는 99.60%로 증가하였다.
  • GA는 ESD 및 SLD와 같이 더 강력한 모델에서 PeZ보다 뛰어난 성능을 보였으며, ESD에서의 노르마리티에 대해 35.79%의 ASR를 기록하였다.
  • 이 방법은 Midjourney와 같은 온라인 서비스 및 ESD, SLD와 같은 최적화된 모델의 안전성 메커니즘을 성공적으로 우회하여 현재의 안전성 방어 조치에 체계적인 약점이 존재함을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.