Skip to main content
QUICK REVIEW

[논문 리뷰] Guided Diffusion Model for Adversarial Purification from Random Noise

Quanlin Wu, Hang Ye|arXiv (Cornell University)|2022. 06. 22.
Adversarial Robustness in Machine Learning인용 수 16
한 줄 요약

이 논문은 난수에서 시작하는 확산 과정을 뒤집어, 오염된 입력으로 유도하는 지도된 확산 모델을 제안한다. 이 모델은 CIFAR-10에서 PGD-ℓ∞ 공격(ε=8/255) 하에 89.62%의 강건한 정확도를 달성하며, 무지식한 확산 정제와 랜덤 스무딩 간의 이론적 연결을 확립하여 기존 기준 방법보다 향상된 인증된 반경을 갖춘 인증된 강건성을 가능하게 한다.

ABSTRACT

In this paper, we propose a novel guided diffusion purification approach to provide a strong defense against adversarial attacks. Our model achieves 89.62% robust accuracy under PGD-L_inf attack (eps = 8/255) on the CIFAR-10 dataset. We first explore the essential correlations between unguided diffusion models and randomized smoothing, enabling us to apply the models to certified robustness. The empirical results show that our models outperform randomized smoothing by 5% when the certified L2 radius r is larger than 0.5.

연구 동기 및 목표

  • 확산 모델을 활용하여 더 효과적이고 인증 가능한 적대적 공격 방어 기법을 개발하기.
  • 무지식한 확산 정제와 랜덤 스무딩 간의 이론적 연결을 탐색하여 인증된 강건성을 확보하기.
  • 적대적 입력을 사용해 난수에서 시작하는 확산 과정을 유도함으로써 적대적 정제의 강건성과 효율성을 향상하기.
  • DDIM를 활용한 확산 기반 정제에서 추론 속도와 강건성 간의 상호 상충 관계를 분석하기.
  • 지속적인 강건성에서 기존 방법들을 능가하는 지도된 확산 정제의 성능을 입증하기, 특히 더 큰 ℓ2 반경에서의 성능을 중심으로.

제안 방법

  • 이 방법은 청소년 이미지에 점진적으로 가우시안 노이즈를 첨가하는 전방 확산 과정을 역행하는 데, 소음 제거 확산 확률 모델(DDPM)을 사용한다.
  • 이들은 소음 제거 네트워크가 적대적 입력에 조건부로 설정된 지도된 역과정을 도입함으로써, 난수에서부터 청소년 이미지를 복원하면서도 입력의 의미적 구조를 유지할 수 있도록 한다.
  • 역과정는 학습된 평균과 분산을 갖는 마르코프 체인으로 공식화되며, 평균은 파arameter θ로 매개변수화된 신경망에 의해 예측된다.
  • 이 방법은 고정된 노이즈 스케줄을 사용하는 비마르코프 역과정을 통해 DDIM을 활용하여 추론 속도를 향상시키며, 단계 수를 1000에서 50으로 감소시킨다.
  • 이론적 분석은 무지식한 확산 과정이 국소 스무딩을 근사함을 보여주며, 이는 인증된 강건성 보장을 도출하는 데 기여한다.
  • 인증된 강건성은 확산 과정을 랜덤 스무딩 메커니즘으로 간주함으로써 확립되며, 모델의 노이즈 내성에서 유도된 인증된 ℓ2 반경이 도출된다.

실험 결과

연구 질문

  • RQ1난수에서 시작하는 지도된 확산 정제가 인증된 강건성에서 무지식한 확산 및 랜덤 스무딩을 능가할 수 있는가?
  • RQ2무지식한 확산 기반 정제와 랜덤 스무딩 간의 이론적 관계는 무엇인가?
  • RQ3지도된 확산 과정은 인증된 강건성 반경과 테스트 정확도에 어떤 영향을 미치는가?
  • RQ4DDIM를 통한 추론 속도와 확산 기반 적대적 정제의 강건성 간의 상호 상충 관계는 어떠한가?
  • RQ5확산 모델이 기존의 생성 모델 기반 접근법보다 더 강력한 인증된 방어를 제공할 수 있는가?

주요 결과

  • 제안된 지도된 확산 모델은 CIFAR-10에서 PGD-ℓ∞ 공격(ε=8/255) 하에 89.62%의 강건한 정확도를 달성하며, 표준 적대적 훈련 기준보다 뛰어난 성능을 보였다.
  • 이 방법은 확산 과정을 국소 스무딩의 형태로 활용함으로써 인증된 강건성을 제공하며, 적대적 편향에 대한 증명 가능한 보장을 가능하게 한다.
  • 인증된 ℓ2 반경 r > 0.5일 경우, 이 방법은 랜덤 스무딩보다 테스트 정확도에서 5% 향상되어 더 뛰어난 인증된 강건성을 입증했다.
  • 난수에서 시작하는 지도된 정제 방식은 무지식한 확산보다 강건성이 크게 향상되었으며, 이는 지도가 모델이 노이즈에서 청소년 이미지를 복원하는 데 집중하도록 돕기 때문이다.
  • DDIM의 사용으로 32×32 이미지당 추론 시간이 약 0.92초로 단축되어 표준 DDPM 대비 효율성이 향상되었다.
  • 이론적 분석은 무지식한 확산 과정이 국소 스무딩을 근사함을 확인하였으며, 이는 인증 방어에의 적용을 정당화하지만, 지도된 설정에 대한 더 날카운 경계는 여전히 열려 있는 도전 과제이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.