[논문 리뷰] On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts
이 논문은 텍스트-이미지 모델에 대한 최초의 사전 공격적 훼손 공격을 제안하며, 정상적인 프롬프트를 사용하여 위험하고 혐오스러운 멤에 유사한 이미지를 생성할 수 있도록 한다. 개념적으로 유사한 프롬프트로 모델을 훼손함으로써, 최소 5개의 샘플로도 높은 성공률를 달성할 수 있지만, 개념적 유사성으로 인해 의도하지 않은 부작용이 발생한다. 이에 대비해 유틸리티 유지 변형은 비대상 프롬프트를 정제함으로써 이러한 문제를 완화하며, FID 점수 상승을 최대 82.47% 감소시킨다.
Malicious or manipulated prompts are known to exploit text-to-image models to generate unsafe images. Existing studies, however, focus on the passive exploitation of such harmful capabilities. In this paper, we investigate the proactive generation of unsafe images from benign prompts (e.g., a photo of a cat) through maliciously modified text-to-image models. Our preliminary investigation demonstrates that poisoning attacks are a viable method to achieve this goal but uncovers significant side effects, where unintended spread to non-targeted prompts compromises attack stealthiness. Root cause analysis identifies conceptual similarity as an important contributing factor to these side effects. To address this, we propose a stealthy poisoning attack method that balances covertness and performance. Our findings highlight the potential risks of adopting text-to-image models in real-world scenarios, thereby calling for future research and safety measures in this space.
연구 동기 및 목표
- 텍스트-이미지 모델이 수동적 프롬프트 조작에 의존하지 않고, 정상적인 프롬프트를 사용하여 사전에 악성 이미지를 생성하도록 조작될 수 있는지 조사한다.
- 개념적 유사성으로 인해 비대상 프롬프트까지 영향을 받는 의도하지 않은 부작용의 위험을 해결한다.
- 공격 효과는 유지하면서 모델 유틸리티의 열화를 최소화하는 유틸리티 유지 공격을 개발한다.
- 부작용을 줄이기 위해 개념적으로 유사한 프롬프트를 식별하고 정제하는 데 도움이 되는 실질적인 통찰을 제공한다.
제안 방법
- 목표로 삼은 혐오스러운 멤에 유사 이미지와 함께 정상 프롬프트가 짝지어진 소규모 데이터셋으로 텍스트-이미지 모델을 훈련시켜 악성 생성을 유도하는 기본 훼손 공격을 제안한다.
- 비대상 프롬프트를 개념적으로 유사하지만 정상적인 변형으로 교체함으로써 부작용을 줄이는 유틸리티 유지 공격을 도입한다.
- 훼손으로 인한 유틸리티 열화를 정량적으로 평가하기 위해 Fréchet Inception Distance (FID)를 사용한다.
- 훼손 효과의 확산 원인으로서 목표 프롬프트와 비대상 프롬프트 간의 개념적 유사성을 규명하기 위해 근본 원인 분석을 수행한다.
- 더 적은 수의 훼손 샘플로도 공격 성공을 이룰 수 있도록, 공격을 유도하는 데 높은 영향을 미치는 프롬프트를 식별하는 '단축' 프롬프트 추출 전략을 적용한다.
- 다양한 비대상 프롬프트에 걸쳐 부작용과 유틸리티 유지 정도를 평가하기 위해 MSCOCO 검증 세트를 활용한다.

실험 결과
연구 질문
- RQ1텍스트-이미지 모델을 정상 프롬프트만으로 사전에 훼손하여 악성 이미지를 생성할 수 있는가?
- RQ2비대상 프롬프트까지도 악성 이미지를 생성하게 하는 의도하지 않은 부작용이 발생하는 주요 요인는 무엇인가?
- RQ3유틸리티 유지 프롬프트 정제 전략은 공격 성공률를 유지하면서 부작용을 어느 정도 줄일 수 있는가?
- RQ4프롬프트 간의 개념적 유사성이 훼손 효과의 확산에 어떤 영향을 미치는가?
- RQ5예를 들어 다섯 개의 샘플만으로도 효과적인 공격 성능를 달성할 수 있는가?
주요 결과
- 기본 훼손 공격는 최소 5개의 훼손 샘플로도 목표로 한 혐오스러운 멤에 이미지를 생성하는 데 성공하며, 텍스트-이미지 모델의 높은 취약성을 입증한다.
- 훼손으로 인해 비대상 프롬프트까지도 악성 이미지를 생성하는 심각한 부작용이 발생하며, 이는 프롬프트 간의 개념적 유사성으로 인한 것이다.
- 근본 원인 분석을 통해 목표 프롬프트와 비대상 프롬프트 간의 개념적 유사성이 부작용 확산의 주요 원인임을 확인한다.
- 유틸리티 유지 공격는 기본 공격 대비 FID 점수 상승을 최대 82.47% 감소시키며, 특히 'Happy Merchant' 멤에 관련된 악성 사례에서 뚜렷한 효과를 보인다.
- '단축' 프롬프트 추출 전략은 공격을 효율적으로 유도하는 데 영향력이 큰 프롬프트를 식별함으로써, 더 적은 샘플로도 성공적인 공격를 가능하게 한다.
- 개념적으로 유사한 프롬프트 하나를 정제하는 것만으로도 여러 비대상 프롬프트에 걸쳐 부작용을 줄일 수 있으며, 이는 의미적 유사성이 훼손 확산에 미치는 영향을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.