Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Attack Generation Empowered by Min-Max Optimization

Jingkang Wang, Tianyun Zhang|arXiv (Cornell University)|2019. 06. 09.
Adversarial Robustness in Machine Learning참고 문헌 66인용 수 10
한 줄 요약

이 논문은 모델 앙상블, 유니버설 편향, 데이터 변환에 대한 강건한 공격 등 다양한 도메인에서의 적대적 공격 생성을 통합하고 향상시키는 최소-최대 최적화 프레임워크를 제안한다. 최악의 경우 공격 손실 최소화 문제를 확률 단체 위의 도메인 가중치에 대한 최소-최대 문제로 공식화함으로써, 이 방법은 공격 성공률을 크게 향상시킨다 — CIFAR-10에서 PGD 대비 각각 17.48%, 35.21%, 9.39% 향상되며, 자가 설명 가능한 도메인 중요도 가중치를 제공한다.

ABSTRACT

The worst-case training principle that minimizes the maximal adversarial loss, also known as adversarial training (AT), has shown to be a state-of-the-art approach for enhancing adversarial robustness. Nevertheless, min-max optimization beyond the purpose of AT has not been rigorously explored in the adversarial context. In this paper, we show how a general framework of min-max optimization over multiple domains can be leveraged to advance the design of different types of adversarial attacks. In particular, given a set of risk sources, minimizing the worst-case attack loss can be reformulated as a min-max problem by introducing domain weights that are maximized over the probability simplex of the domain set. We showcase this unified framework in three attack generation problems -- attacking model ensembles, devising universal perturbation under multiple inputs, and crafting attacks resilient to data transformations. Extensive experiments demonstrate that our approach leads to substantial attack improvement over the existing heuristic strategies as well as robustness improvement over state-of-the-art defense methods trained to be robust against multiple perturbation types. Furthermore, we find that the self-adjusted domain weights learned from our min-max framework can provide a holistic tool to explain the difficulty level of attack across domains. Code is available at https://github.com/wangjksjtu/minmax-adv.

연구 동기 및 목표

  • 적대적 훈련을 초월한 적대적 공격 생성에서 체계적인 최소-최대 최적화의 부족을 해결하기 위해.
  • 모델 앙상블 공격, 유니버설 편향, 변환에 강건한 공격 등 다양한 공격 유형을 단일 최소-최대 최적화 프레임워크 아래 통합하기 위해.
  • 다양한 도메인 환경에서 공격 성능을 떨어뜨리는 히وري스틱 가중치 전략(예: 균일 평균화)을 극복하기 위해.
  • 다른 도메인을 공격하는 데의 상대적 어려움을 반영하는 해석 가능한 도메인 가중치를 제공하기 위해.
  • 다양한 편향 유형을 갖는 일반화된 적대적 훈련을 통해 방어 기능을 확장하기 위해.

제안 방법

  • 최악의 경우 공격 손실 최소화 문제를 도메인 가중치가 확률 단체에 제약을 받는 최소-최대 문제로 공식화한다.
  • 최소-최대 문제를 효율적으로 해결하기 위해 교대형 1단계 투영된 경사 하강 상승(Alternating One-step Projected Gradient Descent Ascent, APGDA) 알고리즘을 도입한다.
  • 공격 생성 과정에서 도메인 가중치를 엔드 투 엔드로 학습함으로써, 모델이 가장 도전적인 도메인을 자가 식별할 수 있도록 한다.
  • 세 가지 공격 유형에 프레임워크를 적용한다: 모델 앙상블 공격, 여러 입력에 걸쳐 유니버설 편향 생성, 데이터 변환에 강건한 공격 제작.
  • 도메인 가중치 메커니즘을 일반화된 적대적 훈련에 적응시켜, 다양한 편향 유형에 대한 강건성을 향상시킨다.
  • 이론적 수렴 분석을 통해 APGDA의 수렴 속도가 T(반복 횟수)에 대해 O(1/T)임을 입증한다.

실험 결과

연구 질문

  • RQ1적대적 훈련을 초월한 최소-최대 최적화는 적대적 공격 생성에 효과적으로 활용될 수 있는가?
  • RQ2모델 앙상블, 유니버설 편향, 변환에 강건한 공격 등 다양한 적대적 공격 환경을 통합할 수 있는 프레임워크는 어떻게 설계할 수 있는가?
  • RQ3학습 가능한 도메인 가중치는 다양한 도메인을 공격하는 데의 상대적 어려움에 대해 해석 가능한 통찰을 제공할 수 있는가?
  • RQ4제안된 최소-최대 프레임워크는 다중 도메인 공격 시나리오에서 히وري스틱 가중치 전략을 초월하는가?
  • RQ5도메인 가중치 메커니즘은 일반화된 적대적 훈련을 개선하고 방어 강건성을 높이기 위해 확장될 수 있는가?

주요 결과

  • 제안된 APGDA 방법은 모델 앙상블 공격에서 기존 PGD 대비 CIFAR-10에서 17.48% 높은 공격 성공률를 달성한다.
  • 여러 이미지에 걸쳐 유니버설 편향 공격을 수행할 경우, 기준 PGD 대비 공격 성공률가 35.21% 향상된다.
  • 데이터 변환에 강건한 공격에서, 기존 PGD 대비 공격 성공률가 9.39% 향상된다.
  • 학습된 도메인 가중치는 다양한 입력을 공격하는 데의 어려움을 정확히 반영하며, 더 강건하거나 공격하기 어려운 이미지에 더 높은 가중치가 할당된다.
  • 일반화된 적대적 훈련에 적용했을 때, 이 프레임워크는 다수의 편향 유형에 대한 최첨단 방어 기법을 능가하는 뛰어난 방어 성능을 제공한다.
  • 시각화 결과는 도메인 가중치가 다양한 편향 노름에 걸쳐 이미지의 강건성을 종합적이고 해석 가능한 척도로 제공함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.