Skip to main content
QUICK REVIEW

[논문 리뷰] Why adversarial training can hurt robust accuracy

Jacob Clarysse, Julia Hörmann|arXiv (Cornell University)|2022. 03. 03.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 공격자가 특정 방향으로 공격하는 경우(예: 마스킹 또는 손상)에, 특히 데이터가 적은 환경에서 적대적 훈련이 비신호 특징에 과적합함으로써 강건한 일반화 능력을 떨어뜨릴 수 있음을 보여준다. 이는 이론적으로 증명하고 실험적으로 검증한 바, 데이터가 부족할 경우 표준 훈련에 비해 적대적 훈련이 강건한 오차를 증가시킨다는 점에서, 일반적으로 적대적 훈련이 강건성을 항상 향상시킨다는 공통된 믿음을 도전한다.

ABSTRACT

Machine learning classifiers with high test accuracy often perform poorly under adversarial attacks. It is commonly believed that adversarial training alleviates this issue. In this paper, we demonstrate that, surprisingly, the opposite may be true -- Even though adversarial training helps when enough data is available, it may hurt robust generalization in the small sample size regime. We first prove this phenomenon for a high-dimensional linear classification setting with noiseless observations. Our proof provides explanatory insights that may also transfer to feature learning models. Further, we observe in experiments on standard image datasets that the same behavior occurs for perceptible attacks that effectively reduce class information such as mask attacks and object corruptions.

연구 동기 및 목표

  • 적은 데이터 환경에서 적대적 훈련이 강건한 일반화 능력을 떨어뜨리는 이유를 조사하기 위해.
  • 적대적 훈련이 항상 강건성을 향상시킨다는 널리 퍼진 믿음을 도전하기 위해.
  • 클래스 신호를 감소시키는 방향성 있는 공격(예: 마스킹 또는 손상)에서 적대적 훈련의 실패 원인을 분석하기 위해.
  • 작은 샘플 설정에서 강건한 오차가 증가하는 데 대한 이론적 및 실험적 증거를 제공하기 위해.
  • 적대적 훈련이 특징 과적합을 통해 강건한 정확도를 떨어뜨리는 메커니즘을 설명하기 위해.

제안 방법

  • 노이즈 없는 관측값을 가진 고차원 선형 분류기의 이론적 분석을 통해, 적대적 훈련 하에서 페르튜르베이션 예산이 증가함에 따라 강건한 오차가 단조롭게 증가함을 증명하기 위해.
  • 적대적 훈련과 표준 훈련 간의 강건한 오차 갭에 대한 고확률 비점근 하한을 유도하기 위해.
  • 정사각형 마스크 변형 및 운동 블러와 같은 눈에 띄는 공격을 사용하여 CIFAR-10, Waterbirds, 수동 제스처 데이터셋에서의 실험적 평가를 수행하기 위해.
  • 훈련 및 추론 중 최적의 블랙마스크 적대적 변형을 찾기 위해 그리드 서치를 사용하기 위해.
  • 로지스틱 회귀 가중치를 시각화하여 적대적 훈련 모델에서 배경 노이즈에 더 의존하는 경향을 보여주기 위해.
  • 작은 데이터 실험에서 정확한 데이터 표현을 확보하기 위해 잘못 촬영된 이미지의 수동 보정을 수행하기 위해.

실험 결과

연구 질문

  • RQ1적대적 훈련은 모든 데이터 환경에서 일관되게 강건한 정확도를 향상시키는가?
  • RQ2왜 적대적 훈련은 작은 샘플 환경에서 강건한 일반화에 실패하는가?
  • RQ3클래스 신호를 감소시키는 방향성 있는 공격이 적대적 훈련 모델의 성능에 어떤 영향을 미치는가?
  • RQ4왜 적대적 훈련은 강건한 오차를 감소시키지 않고 오히려 증가시키는가?
  • RQ5적대적 훈련 모델이 데이터의 비신호 특징에 얼마나 과적합하는가?

주요 결과

  • 적은 샘플 환경에서 적대적 훈련은 대규모 데이터 설정에서는 강건성을 향상시키지만, 표준 훈련에 비해 강건한 오차를 증가시킨다.
  • 분리 가능한 데이터를 가진 고차원 선형 모델에서, 적대적 훈련 하에서 페르튜르베이션 예산이 증가함에 따라 강건한 오차가 단조롭게 증가한다.
  • CIFAR-10 및 Waterbirds에서의 실험 결과, 데이터가 부분 추출되었을 경우 마스킹 및 손상 공격에서 적대적 훈련 하에서 강건한 오차가 더 높게 나타난다.
  • 적대적 훈련을 거친 로지스틱 회귀 모델은 가중치 벡터에서 배경 노이즈가 더 높게 나타나 비신호 영역에 과적합하고 있음을 보여준다.
  • 적대적 훈련을 통해 생성된 분류기는 관련 없는 이미지 조각(예: 배경)에 더 높은 가중치를 할당하여 일반화 성능을 떨어뜨린다.
  • 최적의 변형을 위한 전체 그리드 서치를 수행한 후에도, 적대적 훈련은 강건성을 향상시키지 못하고 소규모 데이터셋에서 성능을 떨어뜨린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.