Skip to main content
QUICK REVIEW

[논문 리뷰] Wasserstein Smoothing: Certified Robustness against Wasserstein Adversarial Attacks

Alexander Levine, Soheil Feizi|arXiv (Cornell University)|2019. 10. 23.
Adversarial Robustness in Machine Learning참고 문헌 22인용 수 16
한 줄 요약

이 논문은 픽셀 이동의 흐름 공간에서 랜덤화 스무딩을 사용하여 워샤르스타인 적대적 공격에 대한 첫 번째 인증된 방어법인 워샤르스타인 스무딩을 제안한다. 이미지 간 차이를 흐름으로 표현하고, 이 공간에서 L1 노름을 통해 워샤르스타인 거리의 상한을 구하여, 인증된 강건성과 보다 뛰어난 경험적 강건성을 MNIST 및 CIFAR-10에서 보호되지 않은 모델에 비해 달성한다.

ABSTRACT

In the last couple of years, several adversarial attack methods based on different threat models have been proposed for the image classification problem. Most existing defenses consider additive threat models in which sample perturbations have bounded L_p norms. These defenses, however, can be vulnerable against adversarial attacks under non-additive threat models. An example of an attack method based on a non-additive threat model is the Wasserstein adversarial attack proposed by Wong et al. (2019), where the distance between an image and its adversarial example is determined by the Wasserstein metric ("earth-mover distance") between their normalized pixel intensities. Until now, there has been no certifiable defense against this type of attack. In this work, we propose the first defense with certified robustness against Wasserstein Adversarial attacks using randomized smoothing. We develop this certificate by considering the space of possible flows between images, and representing this space such that Wasserstein distance between images is upper-bounded by L_1 distance in this flow-space. We can then apply existing randomized smoothing certificates for the L_1 metric. In MNIST and CIFAR-10 datasets, we find that our proposed defense is also practically effective, demonstrating significantly improved accuracy under Wasserstein adversarial attack compared to unprotected models.

연구 동기 및 목표

  • 비가산적이고 워샤르스타인 거리 기반의 적대적 공격에 대한 인증된 방어법이 부족한 문제를 해결하기 위해.
  • 정규화된 픽셀 강도 간의 지구이동 거리로 측정되는 흐름 공격 모델 하에서 분류기의 강건성 인증서를 개발하기 위해.
  • 워샤르스타인 거리를 흐름 표현 공간에서의 L1 거리로 변환하여 기존의 L1 기반 스무딩 인증서를 활용할 수 있도록 하기 위해.
  • 이론적 인증 강건성 외에도 워샤르스타인 공격 하에서 이미지 분류 벤치마크에서 기준 모델 및 다른 방어법보다 우수한 경험적 강건성을 보여주기 위해.

제안 방법

  • 이 방법은 이미지 간 차이를 표현하는 비유일한 흐름 표현을 도입하며, 이 최소 흐름의 L1 노름이 이미지 간 워샤르스타인 거리와 일치한다.
  • 이 흐름 공간 표현을 활용하여 기존의 L1 기반 랜덤화 스무딩 인증서를 적용함으로써 인증된 강건성을 달성한다.
  • 노이즈를 흐름 공간에 추가하여 분류기를 스무딩하며, 스무딩된 분류기의 강건성은 흐름 편향의 L1 노름에 기반한다.
  • 다중 채널 이미지의 경우 각 색상 채널에 대해 별도로 노이즈를 추가함으로써, 부록의 보조정리 2를 통해 강건성 인증을 유지한다.
  • 각 입력에 대해 10,000개의 노이즈 샘플을 사용한 몬테카를로 샘플링을 통해 스무딩된 분류기의 예측을 추정함으로써 인증된 강건성을 계산한다.
  • 경험적 강건성은 워샤르스타인 거리 기반의 프로젝션 경사 하강법 공격을 사용하여 평가하며, 각 기울기 추정에 128개의 노이즈 샘플을 사용한다.

실험 결과

연구 질문

  • RQ1지구이동 거리 기반의 비가산적 워샤르스타인 적대적 공격에 대해 인증된 방어법을 구축할 수 있는가?
  • RQ2흐름 표현 공간에서 워샤르스타인 거리를 L1 거리로 변환하여 기존의 L1 스무딩 인증서를 활용할 수 있는가?
  • RQ3제안된 방법의 경험적 강건성은 워샤르스타인 공격 하에서 보호되지 않은 모델 및 다른 방어법과 비교해 어떻게 되는가?
  • RQ4워샤르스타인 위협 모델에서 인증된 강건성과 경험적 강건성 사이의 격차는 무엇인가?

주요 결과

  • MNIST에서 워샤르스타인 스무딩 방어법은 σ=0.00005일 때 87.01%의 분류 정확도와 0.24%의 기피율을 기록하여, 워샤르스타인 공격 하에서 보호되지 않은 기준 모델에 비해 뚜렷이 뛰어난 성능을 보였다.
  • CIFAR-10에서 이 방법은 σ=0.0002일 때 77.57%의 정확도와 0.66%의 기피율을 기록하여 워샤르스타인 공격에 대해 강력한 경험적 강건성을 입증했다.
  • MNIST의 중앙값 인증 강건성 반경은 0.000223, CIFAR-10는 0.000179였으며, 이는 인증 반경이 중앙값 경험적 공격 반경보다 두 개의 지수 차이만큼 작다는 것을 의미한다.
  • 이 방법은 Wong 등(2019)이 테스트한 표준 모델과 이진화 모델보다 CIFAR-10에서 경험적 강건성이 뛰어났지만, 큰 편향에 대해서는 적대적으로 훈련된 모델에 비해 덜 강건했다.
  • 인증된 강건성이 경험적 강건성보다 뚜렷이 낮게 나타나, 워샤르스타인 거리 기반의 더 강력한 공격이나 개선된 인증서가 필요함을 시사한다.
  • 이 방법은 부록의 보조정리 2에 의해 이론적으로 타당성이 뒷받침되는 바, 각 채널에 대해 별도로 흐름 공간에서 노이즈를 추가함으로써 색상 이미지에 대해서도 효과적으로 작동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.