[논문 리뷰] Implicit Bias of Gradient Descent based Adversarial Training on Separable Data
이 논문은 선형적으로 분리 가능한 데이터에서 경사하강법의 암묵적 편향을 적대적 훈련에서 분석하며, O(1/√T) 속도로 최대 L2 마진 분류기로 수렴함을 보여주며, 청소된 데이터 훈련보다 훨씬 빠르다. 또한 유한한 Lq-노름 편향이 최대 혼합노름 마진 분류기로 이어지며, 적대적 내성에 대한 이론적 근거를 제공한다.
Adversarial training is a principled approach for training robust neural networks. Despite of tremendous successes in practice, its theoretical properties still remain largely unexplored. In this paper, we provide new theoretical insights of gradient descent based adversarial training by studying its computational properties, specifically on its implicit bias. We take the binary classification task on linearly separable data as an illustrative example, where the loss asymptotically attains its infimum as the parameter diverges to infinity along certain directions. Specifically, we show that for any fixed iteration $T$, when the adversarial perturbation during training has proper bounded L2 norm, the classifier learned by gradient descent based adversarial training converges in direction to the maximum L2 norm margin classifier at the rate of $O(1/\sqrt{T})$, significantly faster than the rate $O(1/\log T}$ of training with clean data. In addition, when the adversarial perturbation during training has bounded Lq norm, the resulting classifier converges in direction to a maximum mixed-norm margin classifier, which has a natural interpretation of robustness, as being the maximum L2 norm margin classifier under worst-case bounded Lq norm perturbation to the data. Our findings provide theoretical backups for adversarial training that it indeed promotes robustness against adversarial perturbation.
연구 동기 및 목표
- 선형적으로 분리 가능한 데이터에서 경사하강법의 적대적 훈련에서의 암묵적 편향을 이해하는 것.
- 적대적 편향이 매개변수 공간에서 수렴 방향에 미치는 영향을 분석하는 것.
- 청소된 데이터로 표준 훈련과 비교하여 적대적 훈련의 수렴 속도를 비교하는 것.
- 적대적 편향이 Lq 노름에서 유한할 경우의 결과 분류기 특성화.
- 적대적 훈련에서 관찰된 내성에 대한 이론적 근거 제공.
제안 방법
- 경사하강법 기반의 적대적 훈련 하에서 선형적으로 분리 가능한 데이터에 대한 이진 분류를 분석한다.
- 매개변수들이 매개변수 공간 내 특정 방향으로 무한히 발산하는 극한을 고려하며, 방향 수렴에 집중한다.
- 유한한 L2 노름 편향을 사용하여 최대 L2 노름 마진 분류기로 수렴함을 보여준다.
- 분석을 유한한 Lq 노름 편향으로 확장하여 최대 혼합노름 마진 분류기로 수렴함을 도출한다.
- 손실 함수의 점근적 분석을 통해 최적화 과정의 암묵적 편향을 특성화한다.
- L2-유한 편향에 대해 O(1/√T)를 사용하여 방향 수렴 속도를 확립한다.
실험 결과
연구 질문
- RQ1선형적으로 분리 가능한 데이터에서 적대적 훈련의 경사하강법은 방향으로 어떻게 수렴하는가?
- RQ2청소된 데이터로 표준 훈련과 비교하여 적대적 훈련의 수렴 속도는 어떻게 되는가?
- RQ3편향 노름 선택(L2 대비 Lq)이 적대적 훈련의 암묵적 편향에 어떤 영향을 미치는가?
- RQ4유한한 Lq-노름 편향 하에서 학습된 분류기의 기하학적 해석은 무엇인가?
- RQ5적대적 훈련은 암묵적 편향을 통해 내성을 암묵적으로 촉진하는가?
주요 결과
- 유한한 L2 노름 편향의 경우, 적대적 훈련은 방향으로 최대 L2 노름 마진 분류기로 O(1/√T) 속도로 수렴하며, 표준 훈련의 O(1/log T) 속도보다 훨씬 빠르다.
- 최대 L2 노름 마진 분류기는 매개변수 공간 내 특정 방향으로 발산함에 따라 점차적으로 도달된다.
- 편향이 Lq 노름에서 유한할 경우, 분류기는 최대 혼합노름 마진 분류기로 수렴하며, 이는 최악의 상황에서 Lq-유한 편향에 대한 L2 마진에 해당한다.
- 이 혼합노름 마진 분류기는 적대적 공격에 대한 내성의 자연스러운 이론적 해석을 제공한다.
- 결과적으로 적대적 훈련의 암묵적 편향이 내성과 일치함을 입증하며, 그 경험적 성공에 대한 이론적 근거를 제공한다.
- 적대적 훈련의 수렴 속도인 O(1/√T)는 청소된 데이터로 표준 훈련에서 관찰된 O(1/log T) 속도보다 훨씬 빠르다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.