Skip to main content
QUICK REVIEW

[논문 리뷰] Robustifying Models Against Adversarial Attacks by Langevin Dynamics

Vignesh Srinivasan, Arturo Marbán|arXiv (Cornell University)|2018. 05. 30.
Adversarial Robustness in Machine Learning참고 문헌 62인용 수 13
한 줄 요약

이 논문은 적대적 입력을 원래 클래스의 진짜 데이터 다양체의 고밀도 영역으로 다시 투영하기 위해 메트로폴리스 조정 랑주비안 알고리즘(MALA)을 사용하는 새로운 방어 방법인 MALADE를 제안한다. 조건부 스코어 함수 $\nabla_{\mathbf{x}}\log p(\mathbf{x}|\mathbf{y})$를 지도형 노이즈 제거 autoencoder(sDAE)를 통해 추정함으로써, MALADE는 이웃한 클러스터로의 오분류를 방지함으로써 CIFAR-10과 TinyImageNet에서 화이트박스 및_BLK박스 공격에 대해 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Adversarial attacks on deep learning models have compromised their performance considerably. As remedies, a lot of defense methods were proposed, which however, have been circumvented by newer attacking strategies. In the midst of this ensuing arms race, the problem of robustness against adversarial attacks still remains unsolved. This paper proposes a novel, simple yet effective defense strategy where adversarial samples are relaxed onto the underlying manifold of the (unknown) target class distribution. Specifically, our algorithm drives off-manifold adversarial samples towards high density regions of the data generating distribution of the target class by the Metroplis-adjusted Langevin algorithm (MALA) with perceptual boundary taken into account. Although the motivation is similar to projection methods, e.g., Defense-GAN, our algorithm, called MALA for DEfense (MALADE), is equipped with significant dispersion - projection is distributed broadly, and therefore any whitebox attack cannot accurately align the input so that the MALADE moves it to a targeted untrained spot where the model predicts a wrong label. In our experiments, MALADE exhibited state-of-the-art performance against various elaborate attacking strategies.

연구 동기 및 목표

  • 기존 방어 방법이 빛을 발휘하지 못하는 적응형 공격에 대비하여 딥 네URAL 네트워크의 지속적인 적대적 강건성 문제를 해결하기 위해.
  • 클래스별 다양체 가이던스를 통합하여 기존의 투영 기반 방어를 개선함으로써, 잘못된 클래스 클러스터에 가까워짐으로써 오분류되는 것을 방지하기 위해.
  • 추가 학습 데이터가 필요 없이 화이트박스 및 블랙박스 공격 모두에 강건한 방어 메커니즘을 개발하기 위해.
  • 모수적 분포가 아닌 조건부 분포에 의해 안내되는 스코어 기반 확산을 사용하여 진짜 데이터 다양체에서 효과적인 샘플링을 가능하게 하기 위해.
  • CIFAR-10 및 TinyImageNet과 같은 고차원, 대규모 데이터셋에서 MALADE의 효과성을 입증하기 위해.

제안 방법

  • MALADE는 입력의 예측된 클래스인 $\mathbf{y}$에 조건부한 조건부 데이터 분포 $p(\mathbf{x}|\mathbf{y})$에서 샘플링하기 위해 메트로폴리스 조정 랑주비안 알고리즘(MALA)을 사용한다.
  • 이 방법은 지도형 노이즈 제거 autoencoder(sDAE)를 사용하여 $\nabla_{\mathbf{x}}\log p(\mathbf{x}|\mathbf{y})$의 기울기를 추정하며, 이는 추론 시 진짜 레이블에 대한 명시적 지식이 필요 없이 스코어 함수를 학습한다.
  • MALA는 적대적 입력을 원래 클래스에 해당하는 데이터 다양체의 고밀도 영역으로 반복적으로 변형함으로써 강건성을 향상시킨다.
  • 알고리즘은 클래스 조건부 스코어 추정을 사용하여 인지적 경계를 도입함으로써, 다른 클래스의 저밀도 영역으로의 이탈을 방지한다.
  • 재학습이나 피팅 없이 추론 시점에 적용되므로 사전 학습된 모델과 호환된다.
  • 샘플링 과정을 안정화하기 위해 버닝 인 단계를 사용하며, 최종 예측은 다수의 MALA 샘플에 대한 다수결 투표를 통해 이루어진다.

실험 결과

연구 질문

  • RQ1MALA를 통한 스코어 기반 샘플링이 적대적 입력을 원래 클래스의 진짜 데이터 다양체로 안정적으로 투영할 수 있는가?
  • RQ2조건부 스코어 추정($\nabla_{\mathbf{x}}\log p(\mathbf{x}|\mathbf{y})$)을 통합할 경우, 근사 분포 추정에 비해 방어 강건성이 크게 향상되는가?
  • RQ3MALADE는 PGD-$L_\infty$와 같은 고급 화이트박스 공격과 SaltnPepper 및 경계 공격과 같은 블랙박스 공격에 대해 어떻게 성능을 보이는가?
  • RQ4CIFAR-10 및 TinyImageNet과 같이 데이터 복잡도와 다양체 구조가 더 도전적인 대규모 데이터셋에 대해 MALADE는 일반화 가능한가?
  • RQ5MALADE는 강력한 강건성을 확보하면서도 자연 입력에 대한 높은 정확도를 유지하는가?

주요 결과

  • MALADE는 PGD-$L_\infty$ 화이트박스 공격 하에서 CIFAR-10과 TinyImageNet에서 최신 기술 수준의 방어 방법을 능가하며, 뛰어난 강건성을 입증한다.
  • CIFAR-10에서 MALADE는 $\epsilon = 8/255$ 일 때 PGD-$L_\infty$ 공격에 대해 78.2%의 강건 정확도를 달성하여 기준 모델을 크게 능가한다.
  • TinyImageNet에서는 MALADE가 PGD-$L_\infty$ 공격 하에서 기준 ALP 방어 대비 강건 정확도를 12.3%포인트 향상시켰다.
  • MALADE는 SaltnPepper 및 경계 공격와 같은 다양한 블랙박스 공격 유형에 대해 일관되게 강건성을 향상시키며, 광범위한 스펙트럼의 방어 능력을 보여준다.
  • 제거 분석 결과, 조건부 스코어 추정($p(\mathbf{x}|\mathbf{y})$)이 필수적임을 확인했다. 근사 분포($p(\mathbf{x})$)를 사용한 MALA의 경우 잘못된 클래스 클러스터로의 이탈로 인해 성능이 크게 떨어진다.
  • MALADE는 높은 정순 정확도(예: CIFAR-10에서 92.1%)를 유지함으로써, 강력한 강건성에도 불구하고 자연 입력에 대한 성능 저하가 최소화됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.