Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Robust Overfitting of Adversarial Training and Beyond

Chaojian Yu, Bo Han|arXiv (Cornell University)|2022. 06. 17.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 강력한 적대적 공격자 하에서의 강건한 과적합이 작은 손실을 가진 데이터가 너무 쉽게 피팅될 수 있게 되는 데 기인함을 규명한다. 이를 바탕으로 손실 스케일링 또는 가중치 펌핑을 통해 이러한 데이터의 손실을 증가시키는 최소 손실 제약 적대적 훈련(Minimum Loss Constrained Adversarial Training, MLCAT)을 제안한다. 이는 강건한 과적합을 효과적으로 제거하고 다양한 데이터셋과 아키텍처에서 적대적 강건성을 향상시킨다.

ABSTRACT

Robust overfitting widely exists in adversarial training of deep networks. The exact underlying reasons for this are still not completely understood. Here, we explore the causes of robust overfitting by comparing the data distribution of \emph{non-overfit} (weak adversary) and \emph{overfitted} (strong adversary) adversarial training, and observe that the distribution of the adversarial data generated by weak adversary mainly contain small-loss data. However, the adversarial data generated by strong adversary is more diversely distributed on the large-loss data and the small-loss data. Given these observations, we further designed data ablation adversarial training and identify that some small-loss data which are not worthy of the adversary strength cause robust overfitting in the strong adversary mode. To relieve this issue, we propose \emph{minimum loss constrained adversarial training} (MLCAT): in a minibatch, we learn large-loss data as usual, and adopt additional measures to increase the loss of the small-loss data. Technically, MLCAT hinders data fitting when they become easy to learn to prevent robust overfitting; philosophically, MLCAT reflects the spirit of turning waste into treasure and making the best use of each adversarial data; algorithmically, we designed two realizations of MLCAT, and extensive experiments demonstrate that MLCAT can eliminate robust overfitting and further boost adversarial robustness.

연구 동기 및 목표

  • 강력한 적대적 공격자 설정 하에서 적대적 훈련의 강건한 과적합의 근본 원인을 조사한다.
  • 기존 정규화 기법과 조기 정지가 강건한 과적합을 완화하지 못하는 이유를 이해한다.
  • 적대적 훈련에서 작은 손실을 가진 데이터가 너무 쉽게 피팅될 경우 강건한 과적합을 유발함을 규명한다.
  • 추가 데이터에 의존하지 않고 쉽게 피팅되는 적대적 예제에 대한 과적합을 방지하는 새로운 훈련 철학을 제안한다.
  • 소규모 손실 데이터에 대한 손실을 체계적으로 증가시켜 적대적 강건성을 향상시키는 일반화 가능한 방법을 설계하고 검증한다.

제안 방법

  • 최소 손실 제약 적대적 훈련(MLCAT)을 제안하며, 임계값 ℓ_min를 사용해 데이터를 소손실 그룹과 대손실 그룹으로 분리한다.
  • 소손실 데이터에만 특화된 추가 손실 증가 메커니즘(손실 스케일링 및 가중치 펌핑)을 미니배치 내에서 적용한다.
  • 소손실 예제의 손실을 증가시키기 위해 손실에 계수 ℓ_min / ℓ_i를 곱하는 손실 스케일링을 사용한다.
  • 역전파 동안 모델 가중치에 학습된 벡터 v를 더함으로써 가중치 펌핑을 수행하여 소손실 데이터의 손실을 증가시킨다.
  • 소손실 데이터에만 추가 조치를 적용하기 위해 최소 손실 제약을 도입한다. 이 제약은 손실가 ℓ_min 이하인 데이터에만 적용된다.
  • MLCAT의 두 가지 실현 방식인 MLCAT-LS(손실 스케일링)와 MLCAT-WP(가중치 펌핑)를 설계하였으며, 둘 다 강건한 과적합 억제에 효과적이다.

실험 결과

연구 질문

  • RQ1왜 강력한 적대적 공격자 설정 하에서 적대적 훈련에서 강건한 과적합이 발생하는가?
  • RQ2소손실 데이터는 적대적 훈련 중 강건한 과적합을 유발하는 데 어떤 역할을 하는가?
  • RQ3쉬운 학습이 가능한 적대적 예제의 손실을 선택적으로 증가시킴으로써 강건한 과적합을 완화할 수 있는가?
  • RQ4최소 손실 임계값 ℓ_min는 MLCAT의 과적합 방지 효과에 어떻게 영향을 미치는가?
  • RQ5추가 훈련 데이터나 아키텍처 변경 없이 MLCAT이 적대적 강건성을 향상시킬 수 있는가?

주요 결과

  • 강건한 과적합은 모델이 훈련 과정에서 점점 더 강건해지면서 소손실 데이터의 적대적 예제가 너무 쉽게 피팅될 수 있게 되기 때문에 발생한다.
  • 데이터 제거 실험 결과, 소손실 데이터를 제거하면 강건한 과적합이 발생하지만, 샘플 수 감소로 인해 일반화 성능이 떨어짐을 확인했다.
  • CIFAR-10에서는 ℓ_min = 1.5, CIFAR-100에서는 ℓ_min = 4.0로 설정한 MLCAT는 강건한 과적합을 효과적으로 제거하고 강건성 격차를 거의 0에 가깝게 줄였다.
  • MLCAT-LS와 MLCAT-WP 모두 CIFAR-10, SVHN, CIFAR-100에서 다양한 위협 모델 하에서 강건한 과적합을 제거하고 강건성 정확도를 향상시켰다.
  • 소손실 데이터의 손실을 증가시키는 전략(예: 손실 스케일링, 가중치 펌핑)은 강건성을 향상시키지만, 손실을 감소시키는 전략은 오히려 악화시킨다.
  • 이 방법은 다양한 네트워크 아키텍처(예: PreAct ResNet-18, Wide ResNet)와 위협 모델(예: ℓ∞, ℓ2)에 대해 일반화 가능하며 광범위한 적용 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.