Skip to main content
QUICK REVIEW

[논문 리뷰] Stability Analysis and Generalization Bounds of Adversarial Training

Jiancong Xiao, Yanbo Fan|arXiv (Cornell University)|2022. 10. 03.
Adversarial Robustness in Machine Learning인용 수 9
한 줄 요약

이 논문은 적대적 훈련 안정성 분석을 위해 $η$-근사적 부드러움을 도입하며, 비부드러운 적대적 손실에 대한 SGD의 일반화 한계를 유도한다. 이는 $ε$ 증가에 따라 강건한 테스트 정확도가 $Ω(\epsilon\sqrt{T})$ 와 $\mathcal{O}(\epsilon T)$ 사이의 비율로 저하됨을 보여주며, 강건한 오버피팅을 설명하고, 초기 정지 및 SWA와 같은 기법들이 이론적으로 안정성 향상에 기여함을 검증한다.

ABSTRACT

In adversarial machine learning, deep neural networks can fit the adversarial examples on the training dataset but have poor generalization ability on the test set. This phenomenon is called robust overfitting, and it can be observed when adversarially training neural nets on common datasets, including SVHN, CIFAR-10, CIFAR-100, and ImageNet. In this paper, we study the robust overfitting issue of adversarial training by using tools from uniform stability. One major challenge is that the outer function (as a maximization of the inner function) is nonsmooth, so the standard technique (e.g., hardt et al., 2016) cannot be applied. Our approach is to consider $η$-approximate smoothness: we show that the outer function satisfies this modified smoothness assumption with $η$ being a constant related to the adversarial perturbation $ε$. Based on this, we derive stability-based generalization bounds for stochastic gradient descent (SGD) on the general class of $η$-approximate smooth functions, which covers the adversarial loss. Our results suggest that robust test accuracy decreases in $ε$ when $T$ is large, with a speed between $Ω(ε\sqrt{T})$ and $\mathcal{O}(εT)$. This phenomenon is also observed in practice. Additionally, we show that a few popular techniques for adversarial training (e.g., early stopping, cyclic learning rate, and stochastic weight averaging) are stability-promoting in theory.

연구 동기 및 목표

  • 적대적 훈련에서 훈련 정확도가 증가하는 동안 테스트 정확도가 저하되는 강건한 오버피팅을 설명하는 이론적 격차를 메우기 위해.
  • 표준 균일 안정성 도구가 다룰 수 없는 비부드러운 적대적 손실 함수를 위한 안정성 분석 프레임워크를 개발하기 위해.
  • 적대적 훈련을 포함한 $η$-근사적으로 부드러운 함수에 대한 SGD의 일반화 한계를 도출하기 위해.
  • 일반화 기법(예: 초기 정지, SWA, 순환 학습률)이 안정성 향상에 기여함을 이론적으로 검증하기 위해.
  • 강건한 일반화 갭이 편향 크기 $ε$와 함께 증가함을 보여주며, 실무에서 열악한 테스트 성능을 설명하기 위해.

제안 방법

  • 적대적 훈련에서 외부 함수의 비부드러움을 다루기 위해 표준 부드러움의 일반화로 $η$-근사적 부드러움을 도입하기 위해.
  • 내부 함수의 기울기 리프시츠 상수와 선형적으로 의존하는 $η$에 대해 적대적 손실이 $η$-근사적으로 부드럽다는 것을 증명하기 위해.
  • Hardt 등(2016) 및 Bassily 등(2020)의 이전 결과를 확장하여 $η$-근사적으로 부드러운 함수에 대한 SGD의 안정성 기반 일반화 한계를 도출하기 위해.
  • 유도된 한계를 적대적 훈련에 적용하여 일반화 갭이 $ε$와 $T$에 비례함을 보여주기 위해.
  • 정규화 기법(초기 정지, SWA, 순환 학습률)의 영향을 분석하기 위해, 이들이 한계 내 안정성 관련 항을 감소시킴을 보여주기 위해.
  • 볼록 및 강한 볼록 설정을 사용하여 강건한 오버피팅 현상과 그 $ε$ 및 $T$에 대한 의존도를 시연하기 위해.

실험 결과

연구 질문

  • RQ1적대적 훈련에서 양호한 훈련 성능에도 불구하고 강건한 오버피팅이 발생하는 이유는 무엇인가?
  • RQ2적대적 손실의 비부드러움을 고려할 때, 표준 균일 안정성 도구가 적대적 훈련의 일반화 갭을 설명할 수 있는가?
  • RQ3편향 크기 $ε$는 적대적 훈련의 일반화 성능에 어떤 영향을 미치는가?
  • RQ4초기 정지 및 SWA와 같은 일반적인 정규화 기법들이 적대적 훈련에서 안정성과 일반화를 향상시키는가?
  • RQ5예를 들어 $η$-근사적 부드러움과 같은 수정된 부드러움 가정은 비부드러운 적대적 목표 함수에 대한 일반화 한계를 가능하게 하는가?

주요 결과

  • 내부 함수의 기울기 리프시츠 상수 $L_z$에 대해 적대적 손실은 $η = \mathcal{O}(\epsilon \cdot L_z)$로 $η$-근사적으로 부드럽다.
  • SGD에 대한 $η$-근사적으로 부드러운 함수의 일반화 한계가 도출되었으며, 이는 $ε$ 및 $T$에 의존함을 보여준다.
  • 강건한 테스트 정확도는 $ε$ 증가에 따라 $Ω(\epsilon\sqrt{T})$ 와 $\mathcal{O}(\epsilon T)$ 사이의 비율로 감소하며, 이는 강건한 오버피팅을 설명한다.
  • 초기 정지, 순환 학습률, 스며들어가는 가중치 평균화(SWA)와 같은 기법들이 이론적으로 안정성 향상에 기여함을 보여주며, 일반화 갭을 감소시킨다.
  • 강한 볼록 케이스에서는 일반화 갭이 $\mathcal{O}(\eta + 1/n + 1/T)$로 유계이며, 이는 강건한 오버피팅이 강한 볼록성 하에서는 사라지지만, $\mathcal{O}(\eta)$ 만큼 표준 훈련보다 성능이 열 劣하다는 것을 시사한다.
  • 이론적 분석은 실증 관측과 일치한다: 강건한 오버피팅은 $ε$가 크거나 훈련 기간 $T$가 길수록 더 심해진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.