Skip to main content
QUICK REVIEW

[논문 리뷰] A Geometric Perspective on the Transferability of Adversarial Directions

Zachary Charles, Harrison Rosenberg|arXiv (Cornell University)|2018. 11. 08.
Adversarial Robustness in Machine Learning참고 문헌 4인용 수 6
한 줄 요약

이 논문은 선형 분류기와 두 층의 ReLU 네트워크 간에 적대적 방향이 전이되는 이유를 기하학적 이론으로 설명한다. 선형 분리자에 대해 일반적인 적대적 방향이 존재하고 다른 분류기로 전이될 확률이 높음을 증명하며, ReLU 네트워크의 적대적 방향은 선형 모델로 전이되지만 그 반대는 아님을 보여주며, MNIST 데이터에서 실험적으로 검증된다.

ABSTRACT

State-of-the-art machine learning models frequently misclassify inputs that have been perturbed in an adversarial manner. Adversarial perturbations generated for a given input and a specific classifier often seem to be effective on other inputs and even different classifiers. In other words, adversarial perturbations seem to transfer between different inputs, models, and even different neural network architectures. In this work, we show that in the context of linear classifiers and two-layer ReLU networks, there provably exist directions that give rise to adversarial perturbations for many classifiers and data points simultaneously. We show that these "transferable adversarial directions" are guaranteed to exist for linear separators of a given set, and will exist with high probability for linear classifiers trained on independent sets drawn from the same distribution. We extend our results to large classes of two-layer ReLU networks. We further show that adversarial directions for ReLU networks transfer to linear classifiers while the reverse need not hold, suggesting that adversarial perturbations for more complex models are more likely to transfer to other classifiers. We validate our findings empirically, even for deeper ReLU networks.

연구 동기 및 목표

  • 다양한 분류기와 데이터 포인트 간에 적대적 전이성의 이론적 근거를 이해하는 것.
  • 다양한 분류기 간에 일반적으로 효과적인 적대적 방향이 되는 기하학적 조건을 규명하는 것.
  • ReLU 네트워크와 선형 분류기 간의 전이성 비대칭성에 대해 연구하는 것.
  • FGSM를 사용해 생성한 적대적 예제를 통해 이론적 결과를 MNIST에서 실험적으로 검증하는 것.

제안 방법

  • 최대 마진 서포트 벡터 머신을 이론적으로 분석하여 데이터 포인트와 분류기 간에 전이되는 적대적 방향을 구성하는 것.
  • 선형 및 두 층의 ReLU 네트워크의 결정 경계를 기하학적으로 분석하여 일반적인 적대적 방향의 존재를 증명하는 것.
  • FGSM를 사용한 투영된 경사상승법을 활용해 적대적 예제를 생성하여 실험적 검증을 수행하는 것.
  • ℓ∞ 노름의 다양한 수준에서 각 모델 유형(서포트 벡터 머신과 신경망)에 대해 50,000개의 적대적 예제를 사용해 MNIST에서의 평가를 수행하는 것.
  • 전이성 평가를 위해 무작위 변형, SVM가 생성한, 신경망이 생성한 적대적 예제에 대한 분류기 정확도를 비교하는 것.
  • 적대적 부분공간의 교차 및 방향적 내성에 대한 분석을 통해 이론적 예측을 확인하는 것.

실험 결과

연구 질문

  • RQ1동일한 분포에서 독립적인 데이터 부분집합으로 훈련된 다수의 선형 분류기 간에 적대적 방향이 전이되는 기하학적 조건은 무엇인가?
  • RQ2주어진 데이터셋의 모든 선형 분리자에 대해 일반적인 적대적 방향이 존재하는가? 그리고 최대 마진 분류기와의 관계는 어떠한가?
  • RQ3두 층의 ReLU 네트워크에 대한 적대적 방향이 동일한 클래스의 모든 선형 분류기로 전이될 수 있는가?
  • RQ4왜 전이성이 비대칭적인가? ReLU의 적대적 방향은 선형 모델로 전이되지만 반대는 성립하지 않는가?
  • RQ5ReLU 네트워크와 같은 복잡한 모델에서 생성된 적대적 변형이 SVM과 같은 단순한 모델로 얼마나 잘 전이되는가?

주요 결과

  • 주어진 데이터셋의 모든 선형 분리자에 대해 일반적인 적대적 방향이 존재하며, 그 노름은 최대 마진 분류기만에 의존한다.
  • 동일한 분포에서 독립된 데이터 세트로 훈련된 선형 분류기 간에 적대적 방향은 높은 확률로 전이된다.
  • 두 층의 ReLU 네트워크에 대한 적대적 방향은 다른 모든 ReLU 네트워크와 동일한 클래스의 모든 훈련 데이터로 전이된다.
  • ReLU 네트워크의 적대적 방향은 선형 분류기로 전이되지만 반대는 성립하지 않아 비대칭 전이성이 있음을 시사한다.
  • 실험 결과, SVM과 ReLU 네트워크에서 생성된 적대적 예제가 랜덤 변형보다 유의미하게 더 잘 전이되며, ReLU 네트워크에서 생성된 적대적 예제가 SVM에 더 효과적으로 속임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.