Skip to main content
QUICK REVIEW

[논문 리뷰] On the Limitation of MagNet Defense against $L_1$-based Adversarial Examples

Pei-Hsuan Lu, Pin‐Yu Chen|arXiv (Cornell University)|2018. 04. 14.
Adversarial Robustness in Machine Learning참고 문헌 19인용 수 11
한 줄 요약

이 논문은 자동에코더를 사용한 공격자 탐지기와 데이터 재구성기로 구성된 방어 메커니즘인 MagNet이 엘라스틱넷 공격(EAD)을 통해 제작된 $L_1$-기반 적대적 예제에 대해 효과가 없음을 입증한다. 카를리니 및 웨이거의 $L_2$-기반 공격에 대해 강력한 성능을 보였음에도 불구하고, MagNet은 $L_1$-기반 변형을 탐지하거나 수정하지 못하며, 표준 설정에서 MNIST 및 CIFAR-10에서 공격 성공률가 90%를 초과하여 설계상의 심각한 취약점을 드러낸다.

ABSTRACT

In recent years, defending adversarial perturbations to natural examples in order to build robust machine learning models trained by deep neural networks (DNNs) has become an emerging research field in the conjunction of deep learning and security. In particular, MagNet consisting of an adversary detector and a data reformer is by far one of the strongest defenses in the black-box oblivious attack setting, where the attacker aims to craft transferable adversarial examples from an undefended DNN model to bypass an unknown defense module deployed on the same DNN model. Under this setting, MagNet can successfully defend a variety of attacks in DNNs, including the high-confidence adversarial examples generated by the Carlini and Wagner's attack based on the $L_2$ distortion metric. However, in this paper, under the same attack setting we show that adversarial examples crafted based on the $L_1$ distortion metric can easily bypass MagNet and mislead the target DNN image classifiers on MNIST and CIFAR-10. We also provide explanations on why the considered approach can yield adversarial examples with superior attack performance and conduct extensive experiments on variants of MagNet to verify its lack of robustness to $L_1$ distortion based attacks. Notably, our results substantially weaken the assumption of effective threat models on MagNet that require knowing the deployed defense technique when attacking DNNs (i.e., the gray-box attack setting).

연구 동기 및 목표

  • 블랙박스 무지공격 설정에서 MagNet의 $L_1$-기반 적대적 예제에 대한 강건성을 평가하기 위해.
  • $L_1$-기반 공격(예: EAD)이 MagNet의 방어 모듈을 우회하는 데 $L_2$-기반 공격보다 우월한 이유를 조사하기 위해.
  • 자기에코더 구조와 재구성 손실 함수와 같은 아키텍처 선택이 MagNet의 방어 능력에 미치는 영향을 평가하기 위해.
  • 공격자가 방어 기제를 안다고 가정할 때 MagNet이 강건하다는 가정을 도전하기 위해, $L_1$ 공격가 방어 기제를 알지 못하더라도 성공한다는 것을 보여주기 위해.
  • $L_1$-기반 변형이 MagNet의 탐지기 및 재구성기 구성 요소의 구조적 약점을 악용한다는 경험적 및 분석적 증거를 제공하기 위해.

제안 방법

  • 저자들은 MNIST 및 CIFAR-10 데이터셋에서 $L_1$ 및 $L_2$ 혼합 적대적 예제를 생성하기 위해 엘라스틱넷 공격(EAD)을 사용한다.
  • EAD는 $L_1$ 및 $L_2$ 왜곡 측정치의 조합을 사용하며, 비critical 픽셀에 대한 변형을 최소화하기 위해 희박성 유도 $L_1$ 페널티를 적용한다.
  • MagNet의 방어 능력은 기본 설정과 강건한 변형(예: 256 필터를 가진 수정된 자동에코더 및 평균 절대 오차(MAE) 재구성 손실)를 사용하여 평가된다.
  • 공격 성공률(ASR) 및 공격의 다양한 신뢰 수준($\beta$)에서의 분류 정확도를 통해 방어 성능을 측정한다.
  • 연구는 EAD의 성능을 MagNet의 탐지기($L_1$/$L_2$ 재구성 오차 및 JSD 발산 기반) 및 재구성기(자기에코더 기반 이미지 재구성)와 비교한다.
  • MNIST 및 CIFAR-10에서 광범위한 실험을 수행하였으며, 탐지기 유형, 재구성 손실 함수, 네트워크 깊이에 대한 분석 실험도 실시하였다.

실험 결과

연구 질문

  • RQ1EAD가 생성한 $L_1$-기반 적대적 예제가 블랙박스 무지공격 설정에서 MagNet의 탐지기 및 재구성기 모듈을 성공적으로 우회할 수 있는가?
  • RQ2왜 EAD는 카를리니 및 웨이거의 $L_2$-기반 공격보다 MagNet의 방어 메커니즘을 우회하는 데 더 뛰어나게 작용하는가?
  • RQ3자기에코더의 깊이 및 재구성 손실 함수와 같은 MagNet의 아키텍처 선택이 $L_1$-기반 공격에 대한 강건성에 어떤 영향을 미치는가?
  • RQ4자기에코더 학습에서 평균 절대 오차(MAE)를 사용하면 $L_1$-기반 적대적 예제에 대한 MagNet의 저항력이 향상되는가?
  • RQ5무지공격 모델에서 방어 기제를 알지 못하는 공격자에 대해서도 MagNet의 방어가 어느 정도 실패하는가?

주요 결과

  • MNIST에서 EAD는 $\beta = 10^{-1}$일 때 기본 MagNet의 $L_1$ 규칙에 대해 공격 성공률(ASR)이 90.2%를 기록하여 방어의 거의 완전한 실패를 보여준다.
  • CIFAR-10에서 EAD는 기본 MagNet에 대해 78.6%의 ASR을 기록했고, 강건한 변형(D+256)에 대해서는 91.5%의 ASR을 기록하여, 강화된 MagNet조차도 $L_1$ 공격에 취약함을 보여준다.
  • 자기에코더 학습에서 평균 절대 오차(MAE)를 사용하면 $L_2$ 공격에 대한 방어는 향상되지만, $L_1$-기반 EAD 공격에는 효과가 없으며, 여전히 70% 이상의 ASR을 기록한다.
  • MagNet의 $L_1$ 재구성 오차 기반 탐지기는 $L_1$-기반 적대적 예제를 탐지하는 데 효과적이지 않으며, 낮은 신뢰 수준($\beta = 10^{-3}$)에서도 높은 ASR이 관찰된다.
  • 온도 $T=40$를 사용한 JSD 기반 탐지기는 탐지 성능을 향상시키지만, CIFAR-10에서 EAD가 여전히 60% 이상의 ASR을 기록하여 제한된 강건성을 보여준다.
  • 256 필터를 가진 자기에코더를 사용하더라도, MagNet의 EAD에 대한 방어 능력은 약한 편이며, $\beta = 10^{-1}$일 때 ASR이 93.7%까지 상승하여 아키텍처 스케일링이 $L_1$ 취약성을 해결하지 못한다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.