Skip to main content
QUICK REVIEW

[논문 리뷰] Potential adversarial samples for white-box attacks

Amir Nazemi, Paul Fieguth|arXiv (Cornell University)|2019. 12. 13.
Adversarial Robustness in Machine Learning참고 문헌 16인용 수 16
한 줄 요약

이 논문은 깊이 신경망 특징에 대해 훈련된 SVM의 서포트 벡터를 활용하여 잠재적인 적대적 예측을 식별하는 저비용, 화이트박스 방법을 제안한다. 이 방법은 iFGSM 및 DeepFool 적대적 예측의 82%와 92%를 커버하면서도 테스트 데이터의 61%만을 후보로 사용하여 적대적 공격의 탐색 공간을 크게 줄인다.

ABSTRACT

Deep convolutional neural networks can be highly vulnerable to small perturbations of their inputs, potentially a major issue or limitation on system robustness when using deep networks as classifiers. In this paper we propose a low-cost method to explore marginal sample data near trained classifier decision boundaries, thus identifying potential adversarial samples. By finding such adversarial samples it is possible to reduce the search space of adversarial attack algorithms while keeping a reasonable successful perturbation rate. In our developed strategy, the potential adversarial samples represent only 61% of the test data, but in fact cover more than 82% of the adversarial samples produced by iFGSM and 92% of the adversarial samples successfully perturbed by DeepFool on CIFAR10.

연구 동기 및 목표

  • 탐색 공간을 가장 취약한 샘플들로 좁힘으로써 적대적 공격 알고리즘의 계산 비용을 줄이는 것.
  • 작은 변형이 가장 잘못된 분류를 일으킬 가능성이 높은 결함 경계 근처의 샘플을 식별하는 것.
  • SVM 서포트 벡터를 통해 식별된 고위험 샘플에 집중하여 적대적 훈련을 통해 모델의 강건성을 향상시키는 것.
  • iFGSM 및 DeepFool에 의해 생성된 적대적 예측을 커버하는 데 있어 SVM 기반 후보 선택의 효과를 평가하는 것.
  • SVM을 통해 식별된 경계 근처의 샘플이 화이트박스 공격 시나리오에서 고위험 입력의 대체 지표로 사용될 수 있음을 보여주는 것.

제안 방법

  • 사전 훈련된 DCNN(예: VGG19 또는 LeNet)에서 추출한 특징에 대해 SVM을 훈련시어 결함 경계 근처의 샘플을 식별하는 것.
  • SVM의 서포트 벡터를 결함 경계에 가장 가까운 점이므로 잠재적인 적대적 예측의 대체 지표로 사용하는 것.
  • 후속 적대적 공격 알고리즘의 탐색 공간으로 서포트 벡터만을 선택하는 것.
  • iFGSM 및 DeepFool 공격을 축소된 집합에 적용하여 커버리지와 성공률을 평가하는 것.
  • SVM 정규화 파라미터 C를 조정하여 서포트 벡터의 수를 제어하고 커버리지와 탐색 공간 크기 사이의 균형을 맞추는 것.
  • iFGSM에서는 L∞-노름 기반의 변형을, DeepFool에서는 적응형 스텝 크기를 사용하여 비교를 위한 적대적 예측을 생성하는 것.

실험 결과

연구 질문

  • RQ1SVM 서포트 벡터는 훈련된 DCNN의 결함 경계 근처 샘플을 효과적으로 식별할 수 있는가?
  • RQ2SVM 기반 후보 집합은 얼마나 효과적으로 적대적 공격의 탐색 공간을 줄일 수 있으며, 同시에 높은 수준의 성공적인 적대적 예측 커버리지를 유지할 수 있는가?
  • RQ3SVM 서포트 벡터에 제한되었을 때, iFGSM과 DeepFool 간의 적대적 예측 커버리지에 어떤 차이가 있는가?
  • RQ4C에 의해 제어되는 서포트 벡터의 수가 다양한 공격 파라미터에서 적대적 예측 커버리지와 상관관계가 있는가?
  • RQ5이 방법을 고위험 샘플에 대한 대상 재훈련을 통해 적대적 강건성을 향상시키는 데 사용할 수 있는가?

주요 결과

  • 제안된 방법은 CIFAR10 테스트 세트의 61%만을 사용하여 적대적 탐색 공간을 줄였고, DeepFool에 의해 생성된 적대적 예측의 92%를 커버하였다.
  • iFGSM의 경우, 조그만 변형 크기(ε = 0.01)에서도 CIFAR10에서 82%의 적대적 예측 커버리지를 달성하였다.
  • ε = 0.05일 때, iFGSM는 4,819개의 적대적 예측을 생성했고, C = 0.035일 때 그 중 4,291개가 SVM 기반 후보 집합에 포함되었다.
  • DeepFool의 커버리지는 반복 횟수와 δ 값이 증가할수록 증가하지만, δ = 0.01일 때도 3,667개의 적대적 예측 중 3,376개가 후보 집합에 포함되었다.
  • 이 방법은 MNIST와 CIFAR10 모두에서 뛰어난 성능을 보였으며, 더 복잡한 특징 공간과 깊은 VGG19 아키텍처 덕분에 CIFAR10에서 더 높은 커버리지를 기록하였다.
  • C가 감소할수록 서포트 벡터의 수가 증가하지만, C = 500일 때와 같은 적은 수의 벡터라도 커버리지는 높게 유지되어 효율성과 확장성의 잠재력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.