Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Attacks against Multiple Classifiers

Juan C. Perdomo, Yaron Singer|arXiv (Cornell University)|2019. 06. 06.
Adversarial Robustness in Machine Learning참고 문헌 32인용 수 6
한 줄 요약

이 논문은 다수의 분류기들에 대한 강건한 적대적 공격을 생성하기 위해 게임 이론적 프레임워크를 제안한다. 상호작용을 두 명의 플레이어가 참가하는 0-합 게임으로 모델링하며, 최적의 공격는 Multiplicative Weights Update (MWU)와 최적 반응 오라클을 사용해 나시 균형(Nash equilibrium)을 통해 찾는다. 이 방법은 기존의 기준들보다 뛰어나며, ImageNet에서 최대 16.8%까지, MNIST에서는 30%까지 다수의 분류기의 최대 정확도를 감소시킨다. 이는 강건한 공격 전략을 위해 적대적 노이즈의 랜덤화가 필수적임을 보여준다.

ABSTRACT

We address the challenge of designing optimal adversarial noise algorithms for settings where a learner has access to multiple classifiers. We demonstrate how this problem can be framed as finding strategies at equilibrium in a two-player, zero-sum game between a learner and an adversary. In doing so, we illustrate the need for randomization in adversarial attacks. In order to compute Nash equilibrium, our main technical focus is on the design of best response oracles that can then be implemented within a Multiplicative Weights Update framework to boost deterministic perturbations against a set of models into optimal mixed strategies. We demonstrate the practical effectiveness of our approach on a series of image classification tasks using both linear classifiers and deep neural networks.

연구 동기 및 목표

  • 학습자가 다수의 분류기를 사용할 경우, 단일 모델 공격에 더 강건한 분류기들에 대한 최적의 적대적 공격를 설계하는 데 도전하는 것.
  • 학습자가 다수의 분류기 중에서 선택하는 것과 적대자가 유한한 노이즈를 첨가하는 것 사이의 두 플레이어, 0-합 게임으로 문제를 수식화하는 것.
  • 다양한 결정 경계를 가진 분류기들에 대해 최적의 공격 성능를 달성하기 위해 적대적 노이즈의 랜덤화가 필수적임을 입증하는 것.
  • MWU 프레임워크 내에서 선형 및 딥 네URAL 네트워크 분류기 모두에 대해 효율적인 최적 반응 오라클을 설계하는 것.
  • 이전의 접근 방식들에 비해 다수의 분류기를 동시에 속일 수 있는 방법의 우수성을 경험적으로 검증하는 것.

제안 방법

  • 문제는 학습자(다수의 분류기 중에서 선택)와 적대자(노이즈 첨가) 사이의 0-합 게임으로 모델링되며, 적대자는 최대 분류기 정확도를 최소화하는 것을 목표로 한다.
  • 최적의 혼합 전략(랜덤화된 노이즈)을 계산하기 위해 Multiplicative Weights Update (MWU) 알고리즘을 사용하며, 이는 최적 반응 오라클에 기반해 반복적으로 가중치를 업데이트한다.
  • 선형 분류기의 경우, 볼록 최적화를 사용해 정확한 최적 반응 오라클을 구성하여 주어진 분류기 혼합에 대해 가장 효과적으로 속일 수 있는 노이즈를 정확히 계산할 수 있다.
  • 딥 네URAL 네트워크의 경우, 무타겟 리버스 허프 레이스 손실의 가중합에 대해 PGD를 사용해 최적 반응을 근사함으로써 강건성과 시각적 인지 불가능성을 확보한다.
  • 데이터 차원에서 분류기 수가 일정 수를 초과할 경우 NP-난해한 경우를 다루기 위해 볼록 근사화를 도입하여 다항 시간 내에 근사 최적 해를 보장한다.
  • 손실 함수를 수정함으로써 신경망으로 일반화된 프레임워크를 제공하며, 이는 기울기 기반 최적화를 유지하면서도 제한된 변형을 유지한다.

실험 결과

연구 질문

  • RQ1다양한 결정 경계를 가진 다수의 분류기들에 대해 단일 모델이 아닌 강건한 적대적 공격를 설계할 수 있는가?
  • RQ2다수의 분류기들에 대해 최적의 공격 성능를 달성하기 위해 적대적 노이즈의 랜덤화가 필수적인가?
  • RQ3게임 이론적 균형 개념을 사용해 다수의 분류기들에 대한 최적의 공격를 효율적으로 계산할 수 있는가?
  • RQ4이 프레임워크 내에서 선형 및 딥 네URAL 네트워크 분류기 모두에 대해 최적 반응 오라클을 어떻게 구성할 수 있는가?
  • RQ5MWU 기반의 결정론적 공격 강화가 기존의 앙상블 또는 개별 공격 기준 대비 얼마나 강건한 성능 향상을 보이는가?

주요 결과

  • 선형 다중 클래스 모델을 사용한 MNIST에서는 MWU-Oracle 방법이 분류기의 최대 정확도를 16.8%까지 낮췄으며, 이는 다음으로 우수한 방법(Ensemble)의 55%보다 뚜렷이 뛰어나다.
  • 딥 네URAL 네트워크를 사용한 ImageNet에서는 MWU-Oracle 방법이 공격 하에서 최대 정확도를 36%까지 낮췄으며, 최고의 개별 모델 공격 기준 99%와 앙상블 기준 55%보다 뛰어나다.
  • MWU 강화 없이도 오라클 기반 기준 자체만으로도 MNIST에서 최대 정확도를 30%까지 낮추었고, ImageNet에서는 36%까지 낮추어 강력한 성능를 보였다.
  • MWU를 여러 반복 수행함으로써 공격 품질이 향상되었으며, ImageNet에서 최대 정확도가 추가로 12% 감소하여 강화의 유용성을 확인했다.
  • 분류기들 간 평균 정확도와 최대 정확도의 격차는 평균 성능가 아니라 최악의 경우 성능를 최소화하는 것이 중요함을 시사한다.
  • 앙상블 기준 대비 성능를 맞추기 위해 노이즈 예산을 20%만 증가시켰고, 앙상블 기준은 60% 증가가 필요했기에 더 뛰어난 샘플 효율성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.