[논문 리뷰] Intriguing Properties of Diffusion Models: An Empirical Study of the Natural Attack Capability in Text-to-Image Generative Models
이 논문은 텍스트-이미지 확산 모델에서 인간이 필수적으로 인식하는 강건한 특징(예: 색상, 형태)을 제거하는 프롬프트를 사용함에도 불구하고 DNN 객체 검출기들을 속이는 이미지를 생성할 수 있는 새로운 자연스러운 공격 능력을 규명한다. 이를 자연스러운 노이즈 제거 확산(NDD) 공격이라 명명한다. NDD 공격는 모델이 88%의 탐지율을 보이며 인간의 93%에게는 도드라지지 않아 도청성이 높다. 이는 확산 모델이 임베딩한 비강건한 특징이 효과적이고 모델에 종속되지 않으며, 전이 가능한 대비 공격를 가능하게 한다.
Denoising probabilistic diffusion models have shown breakthrough performance to generate more photo-realistic images or human-level illustrations than the prior models such as GANs. This high image-generation capability has stimulated the creation of many downstream applications in various areas. However, we find that this technology is actually a double-edged sword: We identify a new type of attack, called the Natural Denoising Diffusion (NDD) attack based on the finding that state-of-the-art deep neural network (DNN) models still hold their prediction even if we intentionally remove their robust features, which are essential to the human visual system (HVS), through text prompts. The NDD attack shows a significantly high capability to generate low-cost, model-agnostic, and transferable adversarial attacks by exploiting the natural attack capability in diffusion models. To systematically evaluate the risk of the NDD attack, we perform a large-scale empirical study with our newly created dataset, the Natural Denoising Diffusion Attack (NDDA) dataset. We evaluate the natural attack capability by answering 6 research questions. Through a user study, we find that it can achieve an 88% detection rate while being stealthy to 93% of human subjects; we also find that the non-robust features embedded by diffusion models contribute to the natural attack capability. To confirm the model-agnostic and transferable attack capability, we perform the NDD attack against the Tesla Model 3 and find that 73% of the physically printed attacks can be detected as stop signs. Our hope is that the study and dataset can help our community be aware of the risks in diffusion models and facilitate further research toward robust DNN models.
연구 동기 및 목표
- 텍스트-이미지 확산 모델이 인간 인식에 필수적인 강건한 시각적 특징을 제거함으로써 자연스럽게 대비 공격을 생성할 수 있는지 여부를 조사하는 것.
- 대규모 실험 연구를 통해 이러한 공격의 효과성과 도청성을 체계적으로 평가하는 것.
- 강건한 특징이 포함되거나 제거된 이미지 총 40,870장으로 구성된 NDDA 데이터셋을 구축하고 공개하여 자연스러운 공격 능력을 평가하기 위한 기준 자료로 활용하는 것.
- 실세계 적용 가능성을 평가하기 위해 상용 자율주행 차량을 대상으로 시험하는 것.
- 확산 모델이 초래하는 보안 위험에 대해 연구 공동체에 경각심을 일깨우고 더 강건한 DNN 개발을 촉진하는 것.
제안 방법
- 강건한 시각적 특징(색상, 형태, 텍스트, 무늬)을 명시적으로 제거하는 프롬프트를 사용하여 최신의 세 가지 확산 모델(예: Stable Diffusion, DALL-E 2)을 활용해 이미지를 생성함으로써 NDDA 데이터셋을 구축하였다.
- CLIP와 같은 대비 이미지-텍스트 모델을 사용하여 텍스트 프롬프트에 기반해 이미지를 생성하면서 동시에 인지적 강건성을 체계적으로 저하시켰다.
- 강건한 특징이 있는지 없는지에 따라 5종의 최신 객체 검출기의 탐지율을 측정하여 자연스러운 공격 능력을 평가하였다.
- 사용자 연구를 통해 93%의 참가자가 생성된 이미지의 대비 성격을 인지하지 못함을 확인하여 도청성을 입증하였다.
- 실물 세계 테스트를 위해 대비 정지 신호등을 인쇄하고 상용 자율주행 차량에서 탐지율을 평가하였다.
- 비강건한 특징이 인간에게 인지되지 않지만 DNN에 일반화되는 바탕으로, 인간에게 보이지 않는 흐트러짐에도 불구하고 모델 예측을 유지하는 데 기여하는 특징의 기여도를 분석하였다.
실험 결과
연구 질문
- RQ1최신의 확산 모델이 텍스트 프롬프트를 통해 강건한 시각적 특징을 제거한 후에도 DNN 객체 검출기를 속이는 대비 예제를 생성할 수 있는가?
- RQ2이러한 대비 예제는 인간 관찰자에게 얼마나 도청성이 높으며, 높은 모델 탐지율을 유지하면서 인간의 탐지에서 얼마나 잘 피할 수 있는가?
- RQ3NDD 공격는 다양한 DNN 모델 간에 전이 가능하며, 실세계 자율주행 차량과 같은 실제 환경에 적용 가능한가?
- RQ4인간에게 인지되지 않지만 DNN에 일반화되는 비강건한 특징은 어떻게 확산 모델의 자연스러운 공격 능력을 가능하게 하는가?
- RQ5NDD 공격는 다양한 객체 클래스와 다양한 확산 모델에 대해 얼마나 일반화 가능한가?
주요 결과
- 강건한 특징(빨간색, 8각형 형태 등)이 제거된 정지 신호등 이미지에 대해 NDD 공격는 객체 검출기가 88%의 탐지율을 기록하였다.
- 사용자 연구에서 93%의 인간 참가자가 생성된 이미지의 대비 성격을 인지하지 못하여 도청성이 확인되었다.
- 프롬프트에서 색상, 형태, 텍스트, 무늬의 네 가지 강건한 특징을 모두 제거한 상황에서도 생성된 정지 신호등의 32%가 여전히 객체 검출기에 정지 신호등으로 탐지되었다.
- 실물 세계 테스트 결과, 인쇄된 대비 정지 신호등의 73%가 상용 자율주행 차량에 정지 신호등으로 탐지되었다.
- 연구 결과, 확산 모델이 임베딩한 비강건한 특징이 모델과 작업 간 일반화 가능성이 있어 자연스러운 공격 능력의 핵심 요소임을 확인하였다.
- 15개의 객체 클래스와 6종의 확산 모델을 포함한 총 40,870장의 이미지를 담은 NDDA 데이터셋을 공개하여 향후 확산 모델의 강건성 및 대비 강건성 연구를 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.