Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient Methods Provably Converge to Non-Robust Networks

Gal Vardi, Gilad Yehudai|arXiv (Cornell University)|2022. 02. 09.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 깊이 2 ReLU 네트워크에서 로지스틱 손실 또는 지수 손실로 훈련할 때 경사 하강 흐름이 비록 동일한 훈련 데이터에 대해 강건한 분류기가 존재하더라도 비강건 모델로 수렴함을 증명한다. 핵심 결과는 이러한 네트워크에서 마진 최대화 성향의 암묵적 편향이 본질적으로 적대적 취약성을 유도하며, 크기 O(1) 또는 Õ(d¹ /  4)의 편향이 모든 예측을 뒤바꿀 수 있음을 보여주는데, 이는 입력이 거의 수직일 정도로 경미한 데이터 가정 조건 하에서도 성립한다.

ABSTRACT

Despite a great deal of research, it is still unclear why neural networks are so susceptible to adversarial examples. In this work, we identify natural settings where depth-$2$ ReLU networks trained with gradient flow are provably non-robust (susceptible to small adversarial $\ell_2$-perturbations), even when robust networks that classify the training dataset correctly exist. Perhaps surprisingly, we show that the well-known implicit bias towards margin maximization induces bias towards non-robust networks, by proving that every network which satisfies the KKT conditions of the max-margin problem is non-robust.

연구 동기 및 목표

  • 표준 손실로 훈련된 ReLU 네트워크의 경사 기반 학습이 강건한 분류기가 존재하는 상황에서도 비강건 모델을 도출하는 이유를 설명하는 것.
  • 경사 하강 흐름의 암묵적 편향—특히 마진 최대화 성향—이 깊이 2 ReLU 네트워크에서 적대적 취약성을 유도하는지 조사하는 것.
  • 강건한 해가 가능할 수 있음에도 불구하고 경사 하강 흐름이 비강건 해로 수렴하는 이론적 조건을 설정하는 것.
  • 다양한 데이터 구성 조건 하에서 훈련 데이터셋 전체의 예측을 뒤바꾸는 데 필요한 적대적 편향의 크기를 분석하는 것.
  • 전체 데이터셋 크기의 경계를 두는 대신 마진을 달성하는 부분집합의 크기를 고려하여 이론적 결과를 더 큰 데이터셋으로 확장하는 것.

제안 방법

  • 지수 손실 또는 로지스틱 손실로 훈련된 깊이 2 ReLU 네트워크에서의 경사 하강 흐름에 대한 이론적 분석.
  • 동형 모델에서 경사 하강 흐름이 매개변수 공간에서 최대 마진 문제의 KKT 점으로 수렴한다는 알려진 결과를 활용.
  • 주어진 데이터 가정 하에서 최대 마진 문제의 모든 KKT 해가 본질적으로 비강건함을 증명.
  • 마진 지원 예시들의 합과 정렬된 단일 편향 벡터를 구성함으로써 적대적 강건성 분석 수행.
  • 내적 곱의 구조와 노름 스케일링에 기반한 기하학적 추론을 사용해 예측을 뒤바꾸는 데 필요한 최소 편향 크기를 경계.
  • 전체 데이터셋 크기의 경계를 두는 대신 최대 마진을 달성하는 부분집합의 크기를 경계함으로써 더 큰 데이터셋으로 결과 확장.

실험 결과

연구 질문

  • RQ1표준 손실로 훈련된 깊이 2 ReLU 네트워크에서의 경사 하강 흐름이, 훈련 데이터에 대해 강건한 분류기가 존재함에도 불구하고 비강건 모델로 수렴하는가?
  • RQ2경사 하강 흐름에서의 마진 최대화 성향이 이러한 네트워크에서 적대적 취약성의 근본 원인인가?
  • RQ3이러한 네트워크에서 모든 훈련 예제의 예측을 뒤바꾸는 데 필요한 최소 크기의 적대적 편향은 얼마인가?
  • RQ4입력이 거의 수직일 때, 데이터 차원과 샘플 수에 따라 훈련된 네트워크의 강건성은 어떻게 변화하는가?
  • RQ5전체 데이터셋 크기의 경계를 두는 대신 최대 마진을 달성하는 부분집합의 크기를 고려함으로써 이론적 결과를 작은 데이터셋을 초월해 확장할 수 있는가?

주요 결과

  • m = Θ(d)개의 예제와 max_i≠j |⟨xi,xj⟩| = O(1) 조건 하에서, 경사 하강 흐름은 크기 O(1)의 적대적 편향으로 모든 예측을 뒤바꾸는 네트워크로 수렴한다.
  • m = Õ(√d)개의 예제가 반지름 √d인 구 위에서 균일 분포에서 i.i.d.로 추출될 경우, 크기 Õ(d¹ /  4)의 적대적 편향으로도 모든 레이블을 뒤바꿀 수 있다.
  • 동일한 단일 편향 벡터가 모든 마진 지원 예제의 레이블을 뒤바꿀 수 있으며, 이는 훈련 세트에 대한 통합 적대적 공격를 보여준다.
  • 최소 편향 크기는 √d보다 훨씬 작으며, 이는 레이블을 단순히 뒤바꾸는 데 필요한 임계값이다. 이는 비트리비얼한 강건성 실패를 시사한다.
  • 네트워크의 너비는 적대적 강건성에 거의 영향을 주지 않으며, 너비가 100에서 8000으로 변할 때 편향 크기는 거의 일정하게 유지된다.
  • 전체 데이터셋이 크더라도, 최대 마진을 달성하는 부분집합의 크기가 유한하면 이론적 결과가 그대로 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.