Skip to main content
QUICK REVIEW

[논문 리뷰] WAT: Improve the Worst-class Robustness in Adversarial Training

Boqi Li, Weiwei Liu|arXiv (Cornell University)|2023. 02. 08.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 평균 강건성은 높지만 일부 클래스가 여전히 매우 취약한 문제를 해결하기 위해, 가장 취약한 클래스의 강건성을 최적화하기 위해 no-regret 동역학을 활용하는 새로운 worst-class adversarial training 프레임워크인 WAT를 제안한다. 이는 평균 강건성 정확도를 최소한도로 희생하면서도 가장 열악한 클래스의 강건성 정확도를 크게 향상시킨다. 다양한 공격에 대해 CIFAR-10과 ImageNet-100에서 최신 기준 기반 방법들을 능가하며, 평균 및 worst-class 성능 간의 균형을 잘 반영하는 새로운 지표($ρ$)를 통해 더 나은 트레이드오프 균형을 보여준다.

ABSTRACT

Deep Neural Networks (DNN) have been shown to be vulnerable to adversarial examples. Adversarial training (AT) is a popular and effective strategy to defend against adversarial attacks. Recent works (Benz et al., 2020; Xu et al., 2021; Tian et al., 2021) have shown that a robust model well-trained by AT exhibits a remarkable robustness disparity among classes, and propose various methods to obtain consistent robust accuracy across classes. Unfortunately, these methods sacrifice a good deal of the average robust accuracy. Accordingly, this paper proposes a novel framework of worst-class adversarial training and leverages no-regret dynamics to solve this problem. Our goal is to obtain a classifier with great performance on worst-class and sacrifice just a little average robust accuracy at the same time. We then rigorously analyze the theoretical properties of our proposed algorithm, and the generalization error bound in terms of the worst-class robust risk. Furthermore, we propose a measurement to evaluate the proposed method in terms of both the average and worst-class accuracies. Experiments on various datasets and networks show that our proposed method outperforms the state-of-the-art approaches.

연구 동기 및 목표

  • 강건성 격차 문제를 해결하기 위해, 평균 강건성은 높지만 일부 클래스가 여전히 매우 취약한 상황을 해결한다.
  • 평균 강건성 정확도를 크게 떨어뜨리지 않으면서 worst-class 강건성 정확도를 향상시키는 방법을 개발한다.
  • Rademacher 복잡도를 사용하여 worst-class 강건 위험에 대한 이론적 보장을 제공한다.
  • 평균 및 worst-class 강건 정확도 간의 균형을 수량화하는 새로운 평가 지표($\\rho$)를 제안한다.
  • 다양한 데이터셋과 네트워크 아키텍처에서 제안된 방법의 우수성을 실증적으로 검증한다.

제안 방법

  • 악성 공격 훈련 중 worst-class 강건 위험을 명시적으로 최적화하는 min-max 학습 프레임워크를 제안한다.
  • min-max 최적화 문제를 해결하기 위해 no-regret 동역학을 활용하여 수렴성과 안정성을 보장한다.
  • worst-class 및 평균 강건 정확도 간의 트레이드오프를 제어하기 위한 하이퍼파rameter $\\eta$를 도입한다.
  • 가장 취약한 클래스의 손실에 중점을 두도록 수정된 악성 공격 훈련 목적함수를 사용한다.
  • Rademacher 복잡도 기반 일반화 오차 경계 분석을 통해 이론적 강건성을 정당화한다.
  • 평균 및 worst-class 강건 정확도 간의 균형을 수량화하는 새로운 평가 지표 $\\rho$를 제안한다.

실험 결과

연구 질문

  • RQ1악성 공격 훈련을 재구조화하여 전체 강건성에 손해를 입히지 않고도 가장 성능이 열 劣한 클래스를 우선적으로 고려할 수 있는가?
  • RQ2worst-class 강건 위험을 최소화하기 위해 안정적이고 수렴 가능한 최적화 방법을 어떻게 설계할 수 있는가?
  • RQ3악성 공격 훈련에서 worst-class 강건 위험에 대한 이론적 일반화 오차 경계는 무엇인가?
  • RQ4평균 및 worst-class 강건 정확도를 모두 반영하는 균형 잡힌 평가 지표를 어떻게 정의할 수 있는가?
  • RQ5제안된 방법이 다양한 데이터셋과 모델에서 worst-class 및 평균 강건성 측면에서 기존 방법들을 능가하는가?

주요 결과

  • ResNet-18 기반 CIFAR-10에서 WAT는 PGD-100 공격 하에 worst-class 강건 정확도 69.5%를 기록했고, CW 공격 하에선 33.3%를 기록하여, TRADES 및 기타 기준 기반 방법들을 능가했다.
  • 하이퍼파rameter $\\eta = 0.1$ 설정 시, WAT는 가장 높은 $\\rho_{cw}$ 값인 0.326을 기록하여 평균 및 worst-class 강건 정확도 간의 균형이 가장 우수함을 보였다.
  • WideResNet-34-10에서 WAT는 PGD-100, CW, AutoAttack 공격 모두에서 가장 높은 worst-class 강건 정확도를 기록했으며, 기준 기반 방법들보다 최소 1.3% 이상 향상되었다.
  • 제안된 $\\rho$ 지표는 $CV_{cw}$보다 더 나은 균형 잡힌 평가 척도로 평가되었으며, 평균 및 worst-class 성능을 모두 고려한다.
  • 클래스별 강건 정확도 분석 결과, WAT는 TRADES 및 CSL 대비 가장 취약한 클래스들(예: class-4, class-5)의 성능을 크게 향상시켰다.
  • 하이퍼파rameter 분석 결과, $\\eta = 0.1$이 $\\rho_{nat}$ 및 $\\rho_{cw}$에서 최고 성능을 보였고, $\\eta = 0.5$는 $\\rho_{pgd}$ 및 $\\rho_{AA}$에서 최고 성능을 기록하여 공격 유형에 민감한 특성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.