Skip to main content
QUICK REVIEW

[논문 리뷰] PuVAE: A Variational Autoencoder to Purify Adversarial Examples

Uiwon Hwang, Jaewoo Park|arXiv (Cornell University)|2019. 03. 02.
Adversarial Robustness in Machine Learning참고 문헌 15인용 수 11
한 줄 요약

PuVAE는 변분 추론을 사용하여 각 클래스에 특화된 다양체 위로 적대적 예제를 투영함으로써 적대적 예제를 정제하는 변분 오토에코더 기반 방어법을 제안한다. 이는 Defense-GAN보다 130배 빠른 추론 속도를 기록하며 최신 기술 수준의 강건성을 달성한다. 다양한 공격과 데이터셋에서 적대적 훈련 및 MagNet을 능가하며, 특히 시간 제약 조건 하에서도 뛰어난 성능을 보인다.

ABSTRACT

Deep neural networks are widely used and exhibit excellent performance in many areas. However, they are vulnerable to adversarial attacks that compromise the network at the inference time by applying elaborately designed perturbation to input data. Although several defense methods have been proposed to address specific attacks, other attack methods can circumvent these defense mechanisms. Therefore, we propose Purifying Variational Autoencoder (PuVAE), a method to purify adversarial examples. The proposed method eliminates an adversarial perturbation by projecting an adversarial example on the manifold of each class, and determines the closest projection as a purified sample. We experimentally illustrate the robustness of PuVAE against various attack methods without any prior knowledge. In our experiments, the proposed method exhibits performances competitive with state-of-the-art defense methods, and the inference time is approximately 130 times faster than that of Defense-GAN that is the state-of-the art purifier model.

연구 동기 및 목표

  • 작고 눈에 띄지 않는 변형을 악용하는 적대적 공격에 취약한 딥 네URAL 네트워크의 취약성을 해결한다.
  • 기존 방어 방법의 한계, 즉 공격 유형 간 일반화 능력 부족과 높은 추론 지연을 극복한다.
  • 공격 유형에 대한 사전 지식 없이도 작동하는 빠르고 확장 가능한 정제 메커니즘을 개발한다.
  • 자율 주행과 같은 안전이 중요한 애플리케이션에서 실시간으로 구동 가능한 강건한 모델을 구현한다.
  • 최신 기술 수준의 방어 성능를 확보하면서도 추론 시간을 극적으로 단축시킨다.

제안 방법

  • 각 클래스의 데이터 다양체를 학습하기 위해 클래스 조건부 VAE를 훈련하여 잠재 벡터에서 깨끗한 샘플을 재구성할 수 있도록 한다.
  • 각 적대적 입력에 대해 예측된 클래스 조건 하에 후행 분포에서 잠재 벡터를 샘플링한다.
  • 샘플된 잠재 코드를 사용하여 VAE의 재구성 목적 함수를 최적화함으로써 적대적 예제를 클래스별 다양체 위로 투영한다.
  • 반복 최적화를 피하기 위해 단일 순방향 전파를 통해 VAE 디코더를 통해 정제된 샘플을 생성한다.
  • 재구성 기법을 활용한 미분 가능 샘플링과 정제 과정의 엔드 투 엔드 훈련을 가능하게 한다.
  • 분류기의 파라미터를 훈련 중 고정하여 정제기가 분류기 예측에 과적합되지 않고 적대적 입력을 올바르게 수정하도록 한다.

실험 결과

연구 질문

  • RQ1VAE 기반 정제기가 공격 유형에 대한 사전 지식 없이 다양한 적대적 공격에 대해 강건한 방어를 달성할 수 있는가?
  • RQ2실시간 환경에서 Defense-GAN과 같은 반복적 GAN 기반 방법에 비해 VAE 기반 정제기의 추론 속도는 어떻게 비교되는가?
  • RQ3제안된 방법은 MNIST, Fashion-MNIST, CIFAR-10 등의 여러 데이터셋과 공격 유형에서 높은 분류 정확도를 유지하는가?
  • RQ4VAE 기반 정제 방법은 다양한 모델 아키텍처와 공격 강도에 대해 효과적으로 일반화되는가?
  • RQ5엄격한 시간 제약 조건 하에서 PuVAE의 단일 스텝 추론이 Defense-GAN과 같은 반복적 방법에 비해 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • PuVAE는 MNIST, Fashion-MNIST, CIFAR-10에서 최신 기술 수준의 방어 성능를 기록하며, MagNet을 능가하고 Defense-GAN과 동등한 성능을 내는 등 모든 공격에 대해 승리한다.
  • MNIST 데이터셋에서 PuVAE는 iFGSM 공격에 대해 92.33%의 정확도를 기록했고, CW 공격에선 90.80%를 기록했으며, 이는 Defense-GAN의 73.85%와 72.79%를 뛰어넘는 성과이다. 이는 1초 이내의 시간 제약 조건 하에서도 성립한다.
  • PuVAE의 추론 시간은 128개 이미지 배치당 0.114초이며, 동일한 배치에 대해 Defense-GAN의 14.80초 대비 134.55배 더 빠르다.
  • 1초의 시간 제약 조건 하에서 PuVAE는 FGSM 공격에 대해 81.33%의 정확도, iFGSM에선 92.33%, CW 공격에선 90.80%의 정확도를 기록했으며, 이는 Defense-GAN의 69.25%, 73.85%, 72.79%에 비해 뚜렷이 뛰어나다.
  • PuVAE는 다양한 모델 아키텍처와 공격 유형에 걸쳐 강건한 일반화 성능를 보이며, 모든 설정에서 최고 성능를 내지 못하더라도 일관된 높은 성능를 유지한다.
  • 반복 최적화가 필요 없기 때문에 자율 주행 및 감시 시스템과 같은 실시간 응용 분야에 적합한 높은 성능를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.