Skip to main content
QUICK REVIEW

[논문 리뷰] Evading Adversarial Example Detection Defenses with Orthogonal Projected Gradient Descent

Oliver Bryniarski, Nabeel Hingun|arXiv (Cornell University)|2021. 06. 28.
Adversarial Robustness in Machine Learning인용 수 15
한 줄 요약

이 논문은 분류기 또는 검출기 손실에 대해 기울기 하강을 선택적으로 적용함으로써 낭비되는 변형을 방지함으로써 적대적 예제 생성을 향상시키는 새로운 공격 방법인 수직 프로젝션 기반 기울기 하강(Orthogonal Projected Gradient Descent, OPGD)을 제안한다. 이 방법은 네 가지 최신 검출 방어 기법을 성공적으로 우회하여 분류기 정확도를 0%로 낮추면서도 검출 AUC가 0.5 이하를 유지한다—랜덤 추측보다 열 劣한 성능이다.

ABSTRACT

Evading adversarial example detection defenses requires finding adversarial examples that must simultaneously (a) be misclassified by the model and (b) be detected as non-adversarial. We find that existing attacks that attempt to satisfy multiple simultaneous constraints often over-optimize against one constraint at the cost of satisfying another. We introduce Orthogonal Projected Gradient Descent, an improved attack technique to generate adversarial examples that avoids this problem by orthogonalizing the gradients when running standard gradient-based attacks. We use our technique to evade four state-of-the-art detection defenses, reducing their accuracy to 0% while maintaining a 0% detection rate.

연구 동기 및 목표

  • 분류기와 검출 방어 양쪽을 동시에 속이는 적대적 예제를 생성하는 데 도전하는 것.
  • 이전 공격들이 한 가지 제약(예: 잘못된 분류)을 과도하게 최적화하면서 다른 제약(예: 검출 회피)을 충족시키지 못하는 한계를 극복하는 것.
  • 충족되지 않은 제약에 따라 기울기를 선택적으로 최적화하는 더 단순하고 효과적인 공격 전략을 개발하는 것.
  • 이전에 깨지지 않은 네 가지 검출 방어 기법에 대해 이 방법을 평가하여 그 강건성과 일반화 능력을 입증하는 것.
  • 향후 적대적 강건성 연구 및 평가를 지원하기 위해 실용적이고 오픈소스로 구현된 코드를 제공하는 것.

제안 방법

  • 표준 프로젝션 기반 기울기 하강을 수정하여 기울기 업데이트를 수직화하고, 각 단계에서 분류기 손실 또는 검출기 손실 중 하나에만 선택적으로 적용하는 방식이다.
  • 하나의 하이퍼파rameter λ를 사용해 공동 손실 함수를 최소화하는 대신, OPGD는 아직 충족되지 않은 제약에 따라 f(x)와 g(x)를 번갈아가며 최적화한다.
  • 각 반복에서 알고리즘은 f와 g에 대한 기울기를 계산한 후, 충족되지 않은 제약를 가장 직접적으로 줄이는 기울기를 적용한다.
  • 이 방법은 항상 가장 중요한 제약을 향해 변형을 사용함으로써, 충족된 목표에 대해 낭비되는 최적화를 방지한다.
  • SPAM과 같은 미분 가능한 검출기의 경우, 검출기의 특징 추출 과정에 대해 미분 가능한 근사치를 사용하여 기울기를 역전파한다.
  • 표준 PGD에 최소한의 코드 수정만으로 구현되어 있어 기존의 적대적 공격 파ip라인에 쉽게 통합할 수 있다.

실험 결과

연구 질문

  • RQ1적대적 예제 생성에서 다중 동시 제약을 효율적으로 충족시키는 기울기 기반 공격를 설계할 수 있는가?
  • RQ2선택적이고 수직적인 기울기 하강이 검출 방어를 공격할 때 공동 손실 최적화보다 우월한가?
  • RQ3OPGD는 이전에 깨지 않은 네 가지 검출 방어 기법을 우회하면서 낮은 검출률을 유지할 수 있는가?
  • RQ4OPGD는 표준 위협 모델과 다양한 변형 노름(예: ℓ∞, ℓ2) 하에서 어떻게 성능을 발휘하는가?
  • RQ5기울기 수직성은 변형 효율성과 제약 충족에 어떤 영향을 미치는가?

주요 결과

  • OPGD는 평가된 네 가지 검출 방어 기법 전반에서 보호된 분류기의 정확도를 0%로 낮추는 데 성공했다.
  • 모든 방어 기법에서 검출 AUC가 0.5 이하를 유지하여 랜덤 추측보다 열 劣한 성능을 보였다.
  • SPAM 검출기의 경우, 5%의 위양성률에서 98.8%의 성공률를 기록했으며, 원래 방어의 최고 공격 성공률(3%)보다 뚜렷이 뛰어났다.
  • 허니팟 방어, 디 dense 레이어 분석, 감도 일관성 검출기에서는 100%의 공격 성공률를 기록했다.
  • 공격는 효율적으로 실행되었으며, CIFAR-10에서는 몇 분 내로, ImageNet에서는 몇 시간 내로 단일 GPU에서 실행되었다.
  • SPAM 검출기의 미분 가능한 근사치를 통해 효과적인 기울기 기반 최적화가 가능해졌고, 이로 인해 이전에 비가역적인 방어 기법까지도 공격할 수 있게 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.