[논문 리뷰] Internal Wasserstein Distance for Adversarial Attack and Defense
이 논문은 이미지 간 의미적 유사도를 측정하기 위해 내부 워셔스타인 거리(IWD)를 제안하며, 이는 더 효과적인 적대적 공격 및 방어를 가능하게 한다. IWD를 활용해 다양하고 의미적으로 유사한 적대적 예제를 생성함으로써, ℓp 기반 접근 방식보다 더 큰 변형을 달성하고, IWD 기반 적대적 훈련을 통해 일반화 능력과 강건성을 향상시킨다. 이는 ImageNet에서 공격 성공률과 방어 정확도 면에서 기존 방법들을 능가한다.
Deep neural networks (DNNs) are known to be vulnerable to adversarial attacks that would trigger misclassification of DNNs but may be imperceptible to human perception. Adversarial defense has been an important way to improve the robustness of DNNs. Existing attack methods often construct adversarial examples relying on some metrics like the $\ell_p$ distance to perturb samples. However, these metrics can be insufficient to conduct adversarial attacks due to their limited perturbations. In this paper, we propose a new internal Wasserstein distance (IWD) to capture the semantic similarity of two samples, and thus it helps to obtain larger perturbations than currently used metrics such as the $\ell_p$ distance. We then apply the internal Wasserstein distance to perform adversarial attack and defense. In particular, we develop a novel attack method relying on IWD to calculate the similarities between an image and its adversarial examples. In this way, we can generate diverse and semantically similar adversarial examples that are more difficult to defend by existing defense methods. Moreover, we devise a new defense method relying on IWD to learn robust models against unseen adversarial examples. We provide both thorough theoretical and empirical evidence to support our methods.
연구 동기 및 목표
- 적대적 예제의 의미적 유사도를 측정하는 데 있어 ℓp 노름의 한계를 해결하기 위해, 이는 변형의 다양성과 효과성을 제한한다.
- 데이터 매니폴드의 구조를 활용하여 더 다양하고 강건한 적대적 예제를 생성하는 새로운 공격 방법을 개발하기 위해.
- IWD를 활용한 방어 메커니즘을 설계하여, 미리 보지 못한 적대적 공격에 대한 일반화 능력과 강건성을 향상시키기 위해.
- 공격 오차에 대한 이론적 상한을 유도하여, IWD 기반 훈련을 통한 강건한 방어 설계에 기여하기 위해.
- 데이터 매니폴드의 맹점들을 커버하는 다양한 적대적 예제를 생성하면 딥 네트워크의 강건성이 향상됨을 입증하기 위해.
제안 방법
- 기존의 ℓp 노름을 대체하여, 이미지 간의 내재적 데이터 분포와 의미적 유사도를 캡처하는 내부 워셔스타인 거리(IWD)를 측정 기준으로 제안한다.
- IWD를 사용하여 데이터 매니폴드 상에서 크고 의미적으로 일관된 변형을 갖는 적대적 예제를 생성하는 공격 방법(IWDA)을 개발한다.
- IWD를 사용하여 공격 분류 오차의 상한을 유도하며, 이는 새로운 방어 방법(IWDD)의 설계에 기여한다.
- IWD 최적화된 적대적 예제를 사용하여 모델을 훈련하는 방어 전략(IWDD)을 설계하여, 예측되지 않은 공격에 대한 강건성을 향상시킨다.
- 학습된 특징 공간을 통해 IWD를 계산하는 이중 최적화 프레임워크를 활용하여, 효과적인 기울기 기반 공격과 강건한 훈련을 가능하게 한다.
- 사전 훈련된 모델(예: ResNet-101, Inception-v3)을 사용하고, 미니어처 ImageNet에서 공격 및 방어 성능을 평가한다.
실험 결과
연구 질문
- RQ1ℓp 노름 이외의 측정 기준이 적대적 예제 생성에 있어 의미적 유사도를 더 잘 캡처할 수 있는가?
- RQ2어떻게 하면 더 큰 변형을 달성하면서도 더 다양하고 의미적으로 일관된 적대적 예제를 만들 수 있는가?
- RQ3IWD 기반 적대적 훈련이 예측되지 않은 적대적 공격에 대해 강건성을 향상시킬 수 있는가?
- RQ4IWD와 공격 성공률 사이의 이론적 관계는 무엇이며, 이를 방어 설계에 어떻게 활용할 수 있는가?
- RQ5데이터 매니폴드 상에서 적대적 예제를 생성하면 딥 네트워크의 일반화 능력과 강건성이 향상되는가?
주요 결과
- IWDA는 모든 방법 중 평균 ℓ2 및 ℓ∞ 변형 거리가 가장 크며, 유클리드 공간에서 더 큰 적대적 변형을 의미한다.
- 크기 있는 유클리드 변형에도 불구하고, IWDA는 가장 낮은 IWD 값을 유지하며(0에 가까움), 원본 이미지와 적대적 이미지 간의 높은 의미적 유사도를 확인한다.
- IWDD는 PGD-10 및 FWAdv 공격에서 최신 기술 대비 우수하거나 유사한 강건성을 확보했으며, 정상 정확도에 미미한 손실만을 보였다.
- 절단 분석 결과, τ=0.1 및 β=0.1이 IWDA 및 IWDD의 정상 정확도와 강건 정확도 사이의 최적 균형을 이룬다.
- 정성적 결과는 IWDA가 기존 기준 대비 다양하고 현실적이며 의미적으로 불변하는 적대적 예제를 생성하는 반면, 기준 방법들은 종종 해상도나 부드러움을 손상시킨다.
- 이론적 분석은 다양한 적대적 예제가 데이터 매니폴드의 맹점들을 커버할수록 강건성이 향상됨을 확인하였으며, ImageNet에서의 실증적 검증을 통해 이를 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.