Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Purification: How Adversarial Training Performs Robust Deep Learning

Zeyuan Allen-Zhu, Yuanzhi Li|arXiv (Cornell University)|2020. 05. 20.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 적대적 훈련이 딥 네ural 네트워크의 강건성 향상에 어떻게 기여하는지 설명하기 위해 '특징 정제' 개념을 도입한다. 적대적 훈련이 숨겨진 레이어 가중치 내의 작은 밀도가 높은 혼합물(적대적 취약성의 원인)을 제거함으로써 특징을 정제하고, 단순한 FGSM 기반의 적대적 훈련을 사용하더라도 특정 반경 내의 변형에 대해 증명 가능한 강건성을 달성할 수 있음을 보여준다.

ABSTRACT

Despite the empirical success of using Adversarial Training to defend deep learning models against adversarial perturbations, so far, it still remains rather unclear what the principles are behind the existence of adversarial perturbations, and what adversarial training does to the neural network to remove them. In this paper, we present a principle that we call Feature Purification, where we show one of the causes of the existence of adversarial examples is the accumulation of certain small dense mixtures in the hidden weights during the training process of a neural network; and more importantly, one of the goals of adversarial training is to remove such mixtures to purify hidden weights. We present both experiments on the CIFAR-10 dataset to illustrate this principle, and a theoretical result proving that for certain natural classification tasks, training a two-layer neural network with ReLU activation using randomly initialized gradient descent indeed satisfies this principle. Technically, we give, to the best of our knowledge, the first result proving that the following two can hold simultaneously for training a neural network with ReLU activation. (1) Training over the original data is indeed non-robust to small adversarial perturbations of some radius. (2) Adversarial training, even with an empirical perturbation algorithm such as FGM, can in fact be provably robust against ANY perturbations of the same radius. Finally, we also prove a complexity lower bound, showing that low complexity models such as linear classifiers, low-degree polynomials, or even the neural tangent kernel for this network, CANNOT defend against perturbations of this same radius, no matter what algorithms are used to train them.

연구 동기 및 목표

  • 청결한 데이터로 훈련된 딥 네ural 네트워크에서 적대적 예외가 존재하는 이유를 이해하는 것.
  • 적대적 훈련이 네트워크의 학습된 특징을 근본적으로 어떻게 변화시켜 강건성을 달성하는지 설명하는 것.
  • 표준 훈련 중에 신경망 가중치에서 비강건성의 구조적 원인을 규명하는 것.
  • 적대적 훈련이 낮은 복잡도 모델(예: 선형 분류기, 신경접선 커널)이 달성하지 못하는 강건성을 달성할 수 있음을 증명하는 것.
  • 자연적인 데이터 분포 하에서 두 층의 ReLU 네트워크에 대한 적대적 강건성의 이론적 기반을 구축하는 것.

제안 방법

  • 적대적 훈련이 적대적 취약성을 유발하는 은닉 레이어 가중치 내의 작은 밀도가 높은 혼합물을 제거하는 방식으로 작용하는 메커니즘으로서 '특징 정제' 개념을 도입한다.
  • 비정규 분포를 가진 자연스러운 입력 분포를 가진 두 층의 ReLU 네트워크를 분석하여 특징 학습을 모델링한다.
  • 차이의 범위와 분산이 유한한 마틴게일 농도 부등식을 적용하여 가중치 변형에 따른 네트워크 출력의 이탈을 제한한다.
  • 네트워크 출력을 가중치 레이어를 기반으로 한 조건부 기대값으로 재귀적으로 분해하여 안정성 분석을 수행한다.
  • 적대적 훈련이 반경 r 이내의 변형에 대해 강건성을 달성할 수 있음을 보여주는 이론적 경계를 유도한다.
  • 복잡도 하한선을 증명하여 선형 분류기, 저차수 다항식, 신경접선 커널 모델이 동일한 반경의 변형에 대해 방어할 수 없다는 것을 보여준다.

실험 결과

연구 질문

  • RQ1ReLU 네트워크의 은닉 레이어 가중치에서 표준 훈련 중에 적대적 취약성을 유발하는 구조적 특성은 무엇인가?
  • RQ2적대적 훈련은 네트워크의 내부 표현을 어떻게 변화시켜 강건성을 달성하는가?
  • RQ3단순한 FGSM 기반의 적대적 예제를 사용하더라도, 적대적 훈련이 특정 반경 내의 적대적 변형에 대해 증명 가능한 방어를 달성할 수 있는가?
  • RQ4왜 적대적 예외는 독립적으로 훈련된 모델 간에 전이되는가? 이는 공유된 특징 구조 때문인가?
  • RQ5특정 변형 반경에 대해 강건성을 달성할 수 없는 기본적인 복잡도 한계가 존재하는가?

주요 결과

  • 이론적 설정 하에서 두 층의 ReLU 네트워크에서 단순한 FGSM 알고리즘을 사용하더라도, 적대적 훈련이 반경 r 이내의 변형에 대해 증명 가능한 방어를 달성할 수 있다.
  • 경사 하강법을 사용한 두 층의 ReLU 네트워크의 청결한 훈련은 은닉 가중치 내의 작은 밀도가 높은 혼합물의 누적으로 인해 반경 r 이내의 작은 적대적 변형에 대해 증명 가능한 비강건성을 보인다.
  • 이론적 분석 결과, 특징 정제—즉, 이러한 혼합물의 제거—가 적대적 훈련이 강건성을 달성하는 핵심 메커니즘이라는 것이 밝혀졌다.
  • 복잡도 하한선을 통해 선형 분류기, 저차수 다항식, 신경접선 커널 모델이 어떤 훈련 알고리즘을 사용하든 반경 r 이내의 변형에 대해 방어할 수 없다는 것이 증명되었다.
  • 이 방법은 은닉 가중치의 구조와 적대적 강건성 사이에 증명 가능한 연결고리를 설정하여 강건한 딥 러닝을 이해하는 데 새로운 이론적 시각을 제공한다.
  • CIFAR-10에서의 실증 실험은 특징 정제 원리를 검증하였으며, 적대적 훈련이 유해한 가중치 혼합물을 감소시킨다는 것을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.