Skip to main content
QUICK REVIEW

[논문 리뷰] FenceBox: A Platform for Defeating Adversarial Examples with Data Augmentation Techniques

Han Qiu, Yi Zeng|arXiv (Cornell University)|2020. 12. 03.
Adversarial Robustness in Machine Learning참고 문헌 46인용 수 15
한 줄 요약

FenceBox는 15가지 데이터 증강 기법—이미지 왜곡, 압축, 노이즈 주입으로 분류되는 것들을 활용하여 딥 네ural 네트워크에서 적대적 예제를 완화하는 새로운 방어 플랫폼이다. 비차별적 및 차별적 전처리 함수(예: FD+RDG)를 조합함으로써 표준 공격과 PGD 및 BPDA+EOT와 같은 고급 공격에 효과적으로 저항하며, 50라운드의 적응형 공격 후 최대 55%의 클린 정확도와 17%의 공격 성공률를 기록한다.

ABSTRACT

It is extensively studied that Deep Neural Networks (DNNs) are vulnerable to Adversarial Examples (AEs). With more and more advanced adversarial attack methods have been developed, a quantity of corresponding defense solutions were designed to enhance the robustness of DNN models. It has become a popularity to leverage data augmentation techniques to preprocess input samples before inference to remove adversarial perturbations. By obfuscating the gradients of DNN models, these approaches can defeat a considerable number of conventional attacks. Unfortunately, advanced gradient-based attack techniques (e.g., BPDA and EOT) were introduced to invalidate these preprocessing effects. In this paper, we present FenceBox, a comprehensive framework to defeat various kinds of adversarial attacks. FenceBox is equipped with 15 data augmentation methods from three different categories. We comprehensively evaluated that these methods can effectively mitigate various adversarial attacks. FenceBox also provides APIs for users to easily deploy the defense over their models in different modes: they can either select an arbitrary preprocessing method, or a combination of functions for a better robustness guarantee, even under advanced adversarial attacks. We open-source FenceBox, and expect it can be used as a standard toolkit to facilitate the research of adversarial attacks and defenses.

연구 동기 및 목표

  • 자율 주행 및 홈 오토메이션과 같은 안전 중심 응용 분야에서 점점 증가하는 적대적 예제의 위협을 해결한다.
  • 모델 재학습이 필요하거나 특정 공격 유형에만 특화된 기존 방어 방법의 한계를 극복한다.
  • 입력 전처리 기반의 일반 목적, 경량이며 사용성 유지 방어 프레임워크를 개발한다.
  • 연구자들이 적대적 강건성 및 방어 평가에 대해 통합적이고 개방된 플랫폼을 제공한다.

제안 방법

  • 이미지 왜곡(예: 랜덤 크롭핑, 컬러 조정), 압축(예: JPEG, 가우시안 블러), 노이즈 주입(예: 랜덤 노이즈, 랜덤 다운스케일링)의 세 가지 범주에 걸쳐 15가지 데이터 증강 기능을 통합한 모듈러 플랫폼인 FenceBox를 설계한다.
  • 비차별적 및 차별적 전처리 함수를 조합하여 $ g = g_1 \circ g_2 $ 로 표현하며, 여기서 $ g_1 $ 은 차별적(예: 랜덤 다운스케일링)이고 $ g_2 $ 는 비차별적(예: 랜덤 크롭핑)이다. 이를 통해 기울기 기반 공격를 방해한다.
  • 반복적 적응형 공격(예: $ g_1 $ 기반의 EOT)을 사용하여 강건성을 평가하며, 이는 전처리의 차별적 구성 요소만을 타겟으로 하는 적대자가 방어를 역공학하는 것을 시뮬레이션한다.
  • 다양한 기능 조합(예: FD×3+RDG)을 통해 방어 강도를 높이며, 약한 기능의 조합이 더 강력한 강건성을 낳을 수 있음을 활용한다.
  • 로컬 해석 가능성에 LIME을 활용하여 전처리가 적대적 예제에서 주요 특징을 클린 입력과 유사하게 복원함을 시각화하고 검증한다.
  • FGSM, IFGSM, C&W, LBFGS, PGD, BPDA+EOT 등의 다양한 공격 유형에 대해 방어 성능을 평가하며, 클린 정확도(ACC)와 공격 성공률(ASR)을 측정한다.

실험 결과

연구 질문

  • RQ1일반 목적, 경량 데이터 증강 기능의 조합이 표준 및 고급 기울기 기반 적대적 공격에 효과적으로 대응할 수 있는가?
  • RQ2비차별적 및 차별적 전처리 함수의 조합이 BPDA 및 EOT와 같은 적응형 공격에 대한 강건성에 어떤 영향을 미치는가?
  • RQ3단일 기능을 여러 번 중첩함(예: FD×3+RDG)으로써 방어의 강건성이 단일 기능 대비 얼마나 향상되는가?
  • RQ4LIME과 같은 시각적 설명 방법을 통해 전처리가 적대적 입력에서 원래의 의미 있는 특징에 모델의 주의를 복원함을 확인할 수 있는가?
  • RQ5차별적 전처리 파이프라인의 일부만을 타겟으로 하는 적응형 공격의 계산 비용과 실용적 타당성은 어떠한가?

주요 결과

  • FD(랜덤 다운스케일링)와 RDG(랜덤 가우시안 블러)의 조합은 BPDA+EOT 공격 하에서 공격 성공률(ASR)을 0.06%로 낮혀 고급 공격에 대한 강력한 저항성을 입증하였다.
  • 50라운드의 적응형 EOT 기반 공격 후, FD+RDG 방어는 40%의 클린 정확도와 40%의 ASR 유지를 기록하여 부분적인 취약성은 있으나 공격 비용이 매우 높음을 시사하였다.
  • 세 번의 FD 연산(FD×3+RDG)을 중첩함으로써 클린 정확도는 55%로 상승하고, 50라운드 후 ASR는 17%로 감소하여 강건성이 크게 향상되었다.
  • ASR를 90%로 끌어올리기 위해 FD+RDG는 7,000라운드 이상, FD×2+RDG와 FD×3+RDG는 각각 10,000라운드 이상이 소요되었으며, 이는 복잡도 증가에 따라 수익 감소 현상이 나타남을 보여주었다.
  • LIME 시각화 결과, FD+RDG 전처리가 클린 이미지와 유사한 주의 맵을 복원함을 확인하여 적대적 편향 제거의 효과를 검증하였다.
  • 플랫폼의 오픈소스 배포로 연구자들이 전처리 기능을 체계적으로 평가하고 조합할 수 있게 되어 재현 가능하고 확장 가능한 방어 연구를 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.