[논문 리뷰] Counterstrike: Defending Deep Learning Architectures Against Adversarial Samples by Langevin Dynamics with Supervised Denoising Autoencoder.
이 논문은 적대적 입력을 목표 클래스 분포의 고밀도 다양체로 이완시키기 위해 감독형 노이즈 제거 autoencoder와 함께 랭지에빈 역학을 사용하는 MALADE라는 방어 방법을 제안한다. MALA를 시각적 경계와 함께 활용함으로써, 백색 상자 회피를 억제하는 넓고 산재된 보정을 통해 다양한 적대적 공격에 대해 최신 기술 수준의 강건성을 달성한다.
Adversarial attacks on deep learning models have compromised their performance considerably. As remedies, a lot of defense methods were proposed, which however, have been circumvented by newer attacking strategies. In the midst of this ensuing arms race, the problem of robustness against adversarial attacks still remains unsolved. This paper proposes a novel, simple yet effective defense strategy where adversarial samples are relaxed onto the underlying manifold of the (unknown) target class distribution. Specifically, our algorithm drives off-manifold adversarial samples towards high density regions of the data generating distribution of the target class by the Metroplis-adjusted Langevin algorithm (MALA) with perceptual boundary taken into account. Although the motivation is similar to projection methods, e.g., Defense-GAN, our algorithm, called MALA for DEfense (MALADE), is equipped with significant dispersion - projection is distributed broadly, and therefore any whitebox attack cannot accurately align the input so that the MALADE moves it to a targeted untrained spot where the model predicts a wrong label. In our experiments, MALADE exhibited state-of-the-art performance against various elaborate attacking strategies.
연구 동기 및 목표
- 공격과 방어의 지속적인 경쟁 속에서 딥 러닝 모델의 적대적 강건성 문제를 해결하기 위해.
- 예측 가능한 투영 기반 방어의 취약점을 악용하는 경우가 많은 백색 상자 적대적 공격에 대응할 수 있는 방어 메커니즘을 개발하기 위해.
- 목표 클래스 진짜 데이터 분포의 고밀도 영역으로 다样的체를 이탈한 적대적 샘플을 이동시켜 강건성을 향상시키기 위해.
- 정확한 입력 조작에 의존하는 공격이 방어를 쉽게 우회하지 못하도록 하기 위해 보정 과정에 산재성을 도입하기 위해.
제안 방법
- MALADE는 메트로폴리스 조정 랭지에빈 알고리즘(MALA)을 사용하여 적대적 입력을 목표 클래스의 데이터 다양체로 반복적으로 변형한다.
- 알고리즘은 감독형 노이즈 제거 autoencoder로부터 유도된 시각적 경계를 포함하여 목표 클래스 분포의 고밀도 영역으로 랭지에빈 역학을 이끌어낸다.
- 방어는 autoencoder로부터 학습된 재구성 손실을 사용하여 에너지 함수를 정의하며, 이는 샘플링 과정을 이동시킨다.
- MALA는 기울기 기반 이동과 확률적 제안 단계를 조합함으로써 세부 균형을 확보하고 목표 분포로 수렴한다.
- 방어는 추론 시점에 적용되며, 적대적 입력이 분류기로 전달되기 전에 개선된다.
- 이 방법은 보정 과정에 산재성을 도입하여 백색 상자 공격이 방어의 정확한 출력을 예측하기 어렵게 한다.
실험 결과
연구 질문
- RQ1시각적 지도를 갖춘 랭지에빈 역학은 기존의 투영 기반 방어 대비 적대적 공격에 대해 강건성을 향상시킬 수 있는가?
- RQ2방어 보정 과정에 산재성을 도입하면 백색 상자 공격이 입력을 정확히 조작하여 오분류를 유도하는 것을 방해할 수 있는가?
- RQ3반복 최적화나 기울기 기반 탈출을 사용하는 고급 적대적 공격에 대해 MALADE는 얼마나 효과적인가?
- RQ4다양체 이완 기반 방어는 다양한 공격 시나리오에서 최신 기술 수준의 방법보다 강건성 정확도 측면에서 뛰어나게 성능을 낼 수 있는가?
주요 결과
- MALADE는 PGD, AutoAttack 및 기타 반복적 방법을 포함한 다양한 강력한 적대적 공격에 대해 최신 기술 수준의 강건성 정확도를 달성한다.
- 보정 과정의 넓은 산재성 덕분에 백색 상자 공격에 강건하며, 공격자가 MALADE의 출력을 신뢰성 있게 예측할 수 없게 된다.
- 방어-GAN 및 기타 투영 기반 방법과 비교해 MALADE는 적대적 편향에 대한 강건성 측면에서 뛰어나다.
- 감독형 노이즈 제거 autoencoder의 사용은 효과적인 시각적 경계 추정을 가능하게 하여 다양체 이완 정확도를 향상시킨다.
- 정상 입력 정확도는 유지하면서도 강건성이 크게 향상되어 정확도와 방어 간의 유리한 트레이드오프를 보여준다.
- 실험 결과는 공격이 적응적이고 기울기 정보를 사용하여 탐지 회피를 尝시도하더라도 MALADE가 효과적임을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.