Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Security: Adversarial Defense Using Long-Run Dynamics of Energy-Based Models

Mitch Hill, Jonathan Mitchell|arXiv (Cornell University)|2020. 05. 27.
Adversarial Robustness in Machine Learning참고 문헌 28인용 수 11
한 줄 요약

이 논문은 자연적으로 훈련된 분류기의 후기 훈련 방어 기법을 제안하며, 수렴하는 에너지 기반 모델(EBM)을 사용한 장기 루프 마르코프 체인 몬테카를로(MCMC) 샘플링과 랭제빈 역학을 통해 적대적 입력을 반복적으로 정제한다. 이 방법은 CIFAR-10, SVHN, CIFAR-100에서 최신 기술 수준의 강건한 정확도를 달성하며, 일부 경우에서 표준 적대적 훈련을 능가하지만 분류기의 재훈련이 필요로 하지 않는다.

ABSTRACT

The vulnerability of deep networks to adversarial attacks is a central problem for deep learning from the perspective of both cognition and security. The current most successful defense method is to train a classifier using adversarial images created during learning. Another defense approach involves transformation or purification of the original input to remove adversarial signals before the image is classified. We focus on defending naturally-trained classifiers using Markov Chain Monte Carlo (MCMC) sampling with an Energy-Based Model (EBM) for adversarial purification. In contrast to adversarial training, our approach is intended to secure pre-existing and highly vulnerable classifiers. The memoryless behavior of long-run MCMC sampling will eventually remove adversarial signals, while metastable behavior preserves consistent appearance of MCMC samples after many steps to allow accurate long-run prediction. Balancing these factors can lead to effective purification and robust classification. We evaluate adversarial defense with an EBM using the strongest known attacks against purification. Our contributions are 1) an improved method for training EBM's with realistic long-run MCMC samples, 2) an Expectation-Over-Transformation (EOT) defense that resolves theoretical ambiguities for stochastic defenses and from which the EOT attack naturally follows, and 3) state-of-the-art adversarial defense for naturally-trained classifiers and competitive defense compared to adversarially-trained classifiers on Cifar-10, SVHN, and Cifar-100. Code and pre-trained models are available at https://github.com/point0bar1/ebm-defense.

연구 동기 및 목표

  • 자연적으로 훈련된 딥 네ural 네트워크를 강력한 백색 상자 적대적 공격으로부터 방어할 수 있는 열린 문제를 해결하기 위해.
  • 적대적 훈련과는 다를 뿐 아니라 분류기의 훈련 과정을 수정할 필요가 없는 후기 훈련 방어 기법을 개발하기 위해.
  • CIFAR-10과 같은 복잡한 데이터셋에서 EBM를 사용한 안정적인 장기 루프 MCMC 샘플링을 가능하게 하여, 적대적 신호를 제거하면서도 의미적 콘텐츠를 유지하기 위해.
  • 확률적 방어 기법과 그 공격을 공정하게 평가하기 위해 Expectation-Over-Transformation (EOT)을 도입한 강건한 평가 프레임워크를 제안하기 위해.

제안 방법

  • 비밀번호 기반 에너지 기반 모델(EBM)을 사용하여 입력 이미지에 대해 랭제빈 역학 샘플링을 수행한다. 이 EBM는 레이블이 없는 자연 이미지에 대해 훈련된다.
  • 랭제빈 샘플링은 EBM의 기울기와 주입된 가우시안 노이즈를 사용하여 이미지 픽셀을 반복적으로 갱신하며, 낮은 에너지(자연스러운 보기에 가까운) 구성으로 수렴하게 한다.
  • 장기 루프 MCMC 체인을 통해 정제된 샘플을 생성하며, 이는 비정상 상태의 거동을 활용하여 클래스 일관성을 유지하면서도 적대적 편향을 제거한다.
  • 최종 예측은 여러 개의 독립적인 MCMC 체인에서 얻은 로짓의 평균을 취하여 샘플링 분포에 대한 진짜 기대값을 근사한다.
  • 장기 루프 샘플링을 안정화하기 위해 개선된 수렴 학습 절차를 도입하여, 복잡한 데이터셋에서 효과적인 정제를 가능하게 한다.
  • 확률적 방어 기법을 강건하게 평가하기 위해 Expectation-Over-Transformation (EOT) 방어를 제안하며, EOT 공격은 동일한 프레임워크에서 자연스럽게 유도된다.

실험 결과

연구 질문

  • RQ1수렴하는 EBM를 사용한 장기 루프 MCMC 샘플링이 자연적으로 훈련된 분류기의 적대적 입력을 효과적으로 정제하고 강건성을 복원할 수 있는가?
  • RQ2EBM 샘플링을 사용한 후기 훈련 방어 기법이 자연적으로 훈련된 모델의 강건성에서 표준 적대적 훈련을 능가할 수 있는가?
  • RQ3확률적 방어 기법을 과도하게 추정하지 않기 위해 샘플링의 랜덤 변동성으로부터 공정하게 평가하기 위해 어떻게 해야 하는가?
  • RQ4CIFAR-10과 같은 복잡한 이미지 데이터셋에서 장기 루프 샘플링을 안정적으로 수행하기 위해 EBM 훈련에 어떤 수정이 필요한가?
  • RQ5EBM 기반 정제 기법은 EOT 및 BPDA 변형된 PGD와 같은 가장 강력한 알려진 백색 상자 공격에 효과적으로 대응할 수 있는가?

주요 결과

  • 제안된 EBM 방어 기법은 $\ell_\infty$ 편향 $\varepsilon = 8/255$ 조건에서 SVHN에서 67.55%의 강건한 정확도를 달성하며, 표준 적대적 훈련(50.39%)을 뛰어넘는다.
  • CIFAR-100에서는 동일한 공격 조건에서 26.10%의 강건한 정확도를 기록하며, 표준 적대적 훈련(25.47%)을 능가한다.
  • 이 방법은 CIFAR-10, SVHN, CIFAR-100 전반에서 자연적으로 훈련된 분류기의 최신 기술 수준의 강건한 정확도를 확보하며, 강력한 적응형 공격 조건에서도 유사하게 성능을 유지한다.
  • 개선된 EBM 훈련 절차 덕분에 복잡한 데이터셋에서 현실적인 장기 루프 MCMC 샘플링이 가능해졌으며, 이는 이전에는 불안정하고 방어에 효과적이지 못했던 바이다.
  • EOT 방어 및 공격 프레임워크는 확률적 방어 기법의 공정한 평가를 가능하게 하여 이전 평가에서의 모호함을 해결한다.
  • 이 방어 기법은 EOT 변형된 PGD를 포함한 가장 강력한 알려진 공격에 효과적으로 대응하며, 이전의 사전 처리 기반 방어 기법이 실패하는 상황에서도 강건성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.