Skip to main content
QUICK REVIEW

[논문 리뷰] The Dimpled Manifold Model of Adversarial Examples in Machine Learning

Adi Shamir, Odelia Melamed|arXiv (Cornell University)|2021. 06. 18.
Adversarial Robustness in Machine Learning참고 문헌 16인용 수 4
한 줄 요약

이 논문은 딥 러닝에서의 적대적 예제를 설명하는 새로운 개념적 프레임워크인 Dimpled Manifold Model를 소개한다. 학습 과정에서 결정 경계가 먼저 낮은 차원의 데이터 다양체에 가까이 붙는 단계를 거친 후, 올바르게 분류하기 위해 얕은 돌출부를 형성하는 느린 '주름지기' 단계로 진입한다. 핵심 통찰은 적대적 예제가 이 주름지기 과정에서 자연스럽게 발생한다는 것이며, 이는 작은 노이즈와 유사한 변형과 $L_∞$ 공격에서의 작은 노이즈 특성을 설명한다.

ABSTRACT

The extreme fragility of deep neural networks, when presented with tiny perturbations in their inputs, was independently discovered by several research groups in 2013. However, despite enormous effort, these adversarial examples remained a counterintuitive phenomenon with no simple testable explanation. In this paper, we introduce a new conceptual framework for how the decision boundary between classes evolves during training, which we call the {\em Dimpled Manifold Model}. In particular, we demonstrate that training is divided into two distinct phases. The first phase is a (typically fast) clinging process in which the initially randomly oriented decision boundary gets very close to the low dimensional image manifold, which contains all the training examples. Next, there is a (typically slow) dimpling phase which creates shallow bulges in the decision boundary that move it to the correct side of the training examples. This framework provides a simple explanation for why adversarial examples exist, why their perturbations have such tiny norms, and why they look like random noise rather than like the target class. This explanation is also used to show that a network that was adversarially trained with incorrectly labeled images might still correctly classify most test images, and to show that the main effect of adversarial training is just to deepen the generated dimples in the decision boundary. Finally, we discuss and demonstrate the very different properties of on-manifold and off-manifold adversarial perturbations. We describe the results of numerous experiments which strongly support this new model, using both low dimensional synthetic datasets and high dimensional natural datasets.

연구 동기 및 목표

  • 딥 네ural 네트워크에서 적대적 예제의 존재 및 성질을 단순하고 검증 가능하며 직관적인 설명을 제공하는 것.
  • 적대적 변형이 왜 이렇게 작고 일반적으로 무작위 노이즈처럼 보이는지 오랫동안 미해결된 수수께끼를 해결하는 것.
  • 왜 적대적 예제들이 일반적으로 데이터 다양체에서 벗어나 있으며, 이는 모델 학습 동역학과 어떻게 관련되어 있는지 설명하는 것.
  • 내부 다양체와 외부 다양체에 대한 적대적 변형 간의 차이를 명확히 하고 그 의미를 밝히는 것.
  • 적대적 학습이 결정 경계의 기존 주름을 깊게 하는 데 주로 기여하며, 결정 경계를 근본적으로 변화시키지 않는다는 것을 보여주는 것.

제안 방법

  • 두 단계 학습 과정을 제안: (1) 결정 경계가 낮은 차원의 데이터 다양체에 매우 가까이 붙는 빠른 '붙잡기' 단계, (2) 학습 예제의 올바른 쪽으로 경계를 밀어내기 위해 얕은 돌출부를 형성하는 느린 '주름지기' 단계.
  • 딥 오토에인코더를 사용해 데이터 다양체를 모델링하며, 각 점에서 k차원 기저를 가진 입력 공간 내의 연속적인 조각별 선형 표면으로 근사한다.
  • 데이터 다양체와 결정 경계 간의 기하학적 관계를 분석하여, 입력 공간의 고차원성(n)과 다양체의 저차원성(k) 간의 큰 비율 $\sqrt{n/k}$ 가 적대적 예제의 흔함을 설명한다.
  • $L_2$ 및 $L_\infty$ 노름 공격를 사용하여, $L_\infty$ 변형이 정규화로 인해 무작위 노이즈처럼 보이는 이유를 설명하며, $L_2$ 변형은 정규화되지 않은 기울기를 유지하므로 물체의 구조를 따르며 덜 무작위로 보인다.
  • 합성 2차원 및 고차원 자연 이미지 데이터셋(예: ImageNet)을 사용해 모델을 경험적으로 검증하며, 결정 경계를 지형도 형태로 시각화한다.
  • 적대적 학습이 주름 깊이에 미치는 영향을 분석하여, 기존 주름을 깊게 하는 데 주로 기여하며 새로운 주름을 만드는 데는 기여하지 않는다는 것을 보여준다.

실험 결과

연구 질문

  • RQ1왜 적대적 예제가 존재하며, 그 변형의 노름이 왜 이렇게 작은가?
  • RQ2$L_\infty$-노름 공격에서 변형이 왜 무작위 노이즈처럼 보이는가, 반면 $L_2$-노름 공격에서는 원본 물체의 구조를 따르는가?
  • RQ3학습 과정에서 결정 경계는 어떻게 변화하며, 저차원의 데이터 다양체는 이 변화 과정에서 어떤 역할을 하는가?
  • RQ4내부 다양체와 외부 다양체에 대한 적대적 변형 간의 차이는 무엇이며, 일반화와 강건성과 어떻게 관련되어 있는가?
  • RQ5왜 적대적 학습이 결정 경계의 기존 주름을 깊게 하는 데 주로 기여하며, 결정 경계를 근본적으로 재구성하지 않는가?

주요 결과

  • 결정 경계는 두 단계로 진화한다: 먼저 데이터 다양체에 가까이 붙는 빠른 단계, 그 후 학습 예제를 정확히 분류하기 위해 얕은 돌출부를 형성하는 느린 주름지기 단계.
  • 적대적 예제는 주름지기 과정에서 자연스럽게 발생하므로, 이는 그 존재성과 변형의 작은 노름을 설명한다.
  • FGSM 및 PGD 공격에서 $L_\infty$-정규화된 기울기는 모든 픽셀 변화가 원래 기울기의 크기와 관계없이 동일한 최대 크기 $\epsilon$로 스케일링되기 때문에, 변형이 무작위 노이즈처럼 보인다.
  • 반면, $L_2$-정규화된 공격는 기울기 방향을 유지하므로, 물체의 구조를 따르며 덜 무작위로 보인다.
  • 임의의 벡터의 노름과 그 데이터 다양체에 투영된 값의 비율의 기대값은 $\sqrt{n/k}$ 로 제한되며, 이는 고차원 공간에서 적대적 예제가 흔한 이유를 설명한다.
  • 적대적 학습은 결정 경계의 기존 주름을 깊게 하는 데 주로 기여하며, 새로운 주름을 만드는 데는 기여하지 않아, 모델의 구조를 크게 변경하지 않으면서도 강건성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.