Skip to main content
QUICK REVIEW

[논문 리뷰] Local Reweighting for Adversarial Training

Ruize Gao, Feng Liu|arXiv (Cornell University)|2021. 06. 30.
Adversarial Robustness in Machine Learning참고 문헌 38인용 수 5
한 줄 요약

이 논문은 지역 재가중(Instance-specific reweighting)을 수행하는 Local Reweighting for Adversarial Training (LRAT)을 제안한다. 이는 데이터셋 전체에 걸쳐 전역 재가중을 수행하는 것이 아니라, 공격에 특화된 취약도를 바탕으로 각 공격 쌍 내에서 국소적으로 손실 가중치를 조정한다. LRAT는 미리 정의되지 않은 공격에 대해서도 강건성을 유지하며, PGD, CW 및 AutoAttack 벤치마크에서 표준 적대적 훈련과 GAIRAT와 같은 인스턴스 재가중 방법을 능가한다.

ABSTRACT

Instances-reweighted adversarial training (IRAT) can significantly boost the robustness of trained models, where data being less/more vulnerable to the given attack are assigned smaller/larger weights during training. However, when tested on attacks different from the given attack simulated in training, the robustness may drop significantly (e.g., even worse than no reweighting). In this paper, we study this problem and propose our solution--locally reweighted adversarial training (LRAT). The rationale behind IRAT is that we do not need to pay much attention to an instance that is already safe under the attack. We argue that the safeness should be attack-dependent, so that for the same instance, its weight can change given different attacks based on the same model. Thus, if the attack simulated in training is mis-specified, the weights of IRAT are misleading. To this end, LRAT pairs each instance with its adversarial variants and performs local reweighting inside each pair, while performing no global reweighting--the rationale is to fit the instance itself if it is immune to the attack, but not to skip the pair, in order to passively defend different attacks in future. Experiments show that LRAT works better than both IRAT (i.e., global reweighting) and the standard AT (i.e., no reweighting) when trained with an attack and tested on different attacks.

연구 동기 및 목표

  • 훈련 시 사용된 공격과 다른 공격에 대해 인스턴스 재가중 적대적 훈련(IRAT)의 강건성 저하 문제를 해결하기 위해.
  • 훈련 공격에 대해 강건성을 향상시키지만, 미리 보지 않은 공격에서는 실패하는 전역 재가중 전략(GAIRAT)의 원인을 규명하기 위해.
  • 공격에 따라 달라지는 새로운 재가중 전략을 제안하여 다양한 적대적 공격에 대한 일반화 능력을 향상시키기 위해.
  • 훈련 시 공격이 잘못 지정된 경우에도 공격 쌍 내에서 국소 재가중을 유지함으로써 모델의 강건성이 손상되지 않음을 입증하기 위해.

제안 방법

  • LRAT는 각 자연 입력을 여러 공격(PGD 및 CW 등)에 대해 생성한 적대적 변형과 쌍으로 묶어 국소 그룹을 형성하고, 이를 기반으로 재가중을 수행한다.
  • 모델의 신뢰도와 적대적 거리에 따라 의존하는 학습 가능한 가중치 함수를 사용하여 각 쌍 내에서 취약도 기반 재가중을 적용한다.
  • 모든 인스턴스에 대해 단일 전역 가중치를 할당하지 않음으로써 전역 재가중을 피하고, 대신 각 적대적 쌍 내에서의 상대적 중요도에 집중한다.
  • 예외적으로 유용한 예시가 제거되는 것을 방지하기 위해 인스턴스 가중치에 부드러운 하한값([N] 및 [P] 항을 통해)을 도입한다.
  • 자연 및 적대적 예제에 대한 가중 손실을 조합하며, 공격에 특화된 취약도 점수에서 유도된 가중치를 사용한다.
  • 이 프레임워크는 일반적이며, 어떤 공격 유형이나 취약도 측정 지표와도 결합 가능하므로, 다양한 방어 설계에 대해 민첩하고 강건한 접근이 가능하다.

실험 결과

연구 질문

  • RQ1왜 인스턴스 재가중 적대적 훈련(IRAT)은 훈련 공격에 대해 강건성을 향상시키지만, 다른 공격에 대해서는 일반화에 실패하는가?
  • RQ2데이터 인스턴스의 취약도는 다양한 적대적 공격 간에 일관된가, 아니면 공격에 따라 달라지는가?
  • RQ3전역 재가중 전략에 비해, 적대적 쌍 내에서 국소 재가중이 미리 보지 않은 공격에 대해 강건성을 향상시킬 수 있는가?
  • RQ4인스턴스 가중치에 하한값을 유지하는 것이, 적응형이거나 알려지지 않은 공격에 대비하여 방어에 기여하는가?

주요 결과

  • ResNet-18를 사용한 CIFAR-10에서, LRAT는 PGD 공격 하에서 53.52%의 강건 정확도를 기록했으며, CW 공격 하에서는 50.71%를 기록하여 GAIRAT 및 표준 AT를 크게 능가했다.
  • AutoAttack (AA)에서, ([N]+P+C) 변형을 사용한 LRAT는 48.60%의 강건 정확도를 달성했으며, 훈련 중에 AA를 시뮬레이션하지 않았음에도 불구하고 기준 방법보다 일관되게 향상된 성능을 보였다.
  • 제거 실험 결과, 국소 재가중(P+C)이 전역 재가중(P 또는 C 단독)보다 우수하며, 후자는 새로운 공격에 대해 성능 저하가 심각하게 나타났다.
  • [N] 및 [P] 항을 통해 부드러운 하한값을 도입한 결과, AutoAttack에서의 강건성이 향상되어, 적응형 또는 알려지지 않은 공격에 대비하는 데서 그 가치가 입증되었다.
  • LRAT는 다양한 공격 하에서 모델 장애의 위험을 줄이며, 전역 재가중 전략에 비해 더 균형 잡히고 일반화 능력이 뛰어난 방어를 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.