Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Detection and Correction by Matching Prediction Distributions

Giovanni Vacanti, Arnaud Van Looveren|arXiv (Cornell University)|2020. 02. 21.
Adversarial Robustness in Machine Learning참고 문헌 22인용 수 13
한 줄 요약

이 논문은 원본 입력과 복원된 입력 간의 분류기 예측 분포를 일치시키기 위해 쿨백-라이블러 발산 손실을 사용해 훈련된 오토인코더를 활용한 비지도 적대적 탐지 및 수정 방법을 제안한다. 이 방법은 MNIST 및 Fashion-MNIST에서 강력한 회색 상자 공격(예: Carlini-Wagner, SLIDE)을 거의 완벽하게 탐지하며, 흰색 상자 조건에서도 CIFAR-10에서 매우 효과적으로 작동한다. 또한 CIFAR-10-C에서의 데이터 오염 또한 탐지한다.

ABSTRACT

We present a novel adversarial detection and correction method for machine learning classifiers.The detector consists of an autoencoder trained with a custom loss function based on the Kullback-Leibler divergence between the classifier predictions on the original and reconstructed instances.The method is unsupervised, easy to train and does not require any knowledge about the underlying attack. The detector almost completely neutralises powerful attacks like Carlini-Wagner or SLIDE on MNIST and Fashion-MNIST, and remains very effective on CIFAR-10 when the attack is granted full access to the classification model but not the defence. We show that our method is still able to detect the adversarial examples in the case of a white-box attack where the attacker has full knowledge of both the model and the defence and investigate the robustness of the attack. The method is very flexible and can also be used to detect common data corruptions and perturbations which negatively impact the model performance. We illustrate this capability on the CIFAR-10-C dataset.

연구 동기 및 목표

  • 공격 유형이나 모델 방어에 대한 사전 지식이 필요 없는 강력한 비지도 적대적 탐지 및 수정 방법을 개발하는 것.
  • 입력 복원 오차가 아닌 분류기의 출력 확률 분포에 초점을 맞춰 적대적 예제의 탐지 성능을 향상시키는 것.
  • MNIST, Fashion-MNIST, CIFAR-10와 같은 다양한 데이터셋에서 강력한 회색 상자 및 흰색 상자 공격에 대한 이 방법의 효과성을 평가하는 것.
  • 실제 운영 환경에서의 해로운 데이터 오염 및 분포 이탈을 탐지하기 위해 이 방법의 유용성을 확장하는 것.
  • 다양한 데이터 모odal리티에 적용 가능한 유연하고 일반적인 방어 메커니즘을 제공하는 것.

제안 방법

  • 이 방법은 원본 입력과 복원된 입력에 대한 분류기의 예측 확률 간 쿨백-라이블러 발산을 기반으로 한 고유한 손실 함수를 사용해 훈련된 오토인코더를 활용한다.
  • 오토인코더는 대칭적이고 아티팩트가 없는 복원을 학습하여 원본 분류기의 출력 분포를 유지함으로써 적대적 편향을 효과적으로 제거한다.
  • 적대적 점수는 원본 입력과 복원된 입력에 대한 분류기 예측 간 쿨백-라이블러 발산으로 계산되며, 이는 탐지 신호로 기능한다.
  • 방어는 레이블이 부여된 적대적 예제나 공격 전략에 대한 지식이 필요 없는 비지도 방식으로 훈련된다.
  • CIFAR-10-C 벤치마크와 같은 오염된 입력에서의 적대적 점수 측정을 통해 데이터 드리프트 탐지를 확장한다.
  • 이 방법은 모듈러하며, 다양한 아키텍처를 가진 다수의 오토인코더를 사용한 앙상블 학습을 통해 강화될 수 있다.

실험 결과

연구 질문

  • RQ1원본 입력과 복원된 입력 간의 예측 분포 일치를 기반으로 한 방어 메커니즘이 강력한 회색 상자 적대적 공격을 효과적으로 탐지할 수 있는가?
  • RQ2공격자가 모델과 방어 전략을 모두 알고 있는 흰색 상자 공격 상황에서 이 방법의 탐지 성능는 어떠한가?
  • RQ3예측 분포 간 쿨백-라이블러 발산에서 유도된 적대적 점수가 일반적인 데이터 오염 및 분포 이탈을 탐지하는 데 일반화되는가?
  • RQ4모델 앙상블은 이동 가능한 공격에 대한 탐지 시스템의 강건성에 어느 정도 기여하는가?
  • RQ5이 방법은 아키텍처나 하이퍼파라미터 조정 없이 다양한 데이터 모달리티와 분류기 아키텍처에 일반적으로 적용 가능한가?

주요 결과

  • 이 방법은 MNIST 및 Fashion-MNIST에서 Carlini-Wagner 및 SLIDE 공격을 거의 완전히 중립화하며, 대부분의 경우 탐지 AUC 값이 0.95를 초과한다.
  • CIFAR-10에서 이 방법은 흰색 상자 공격 조건에서도 높은 탐지 성능 유지를 보이며, C&W 공격의 AUC 값은 0.7673, SLIDE는 0.7268이며, FGSM의 경우 다양한 ε 값에서 최대 0.85의 AUC를 기록한다.
  • 적대적 점수는 CIFAR-10-C의 데이터 오염을 효과적으로 탐지하며, 오염으로 인해 잘못 분류된 유해한 인스턴스의 점수는 영향을 받지 않은 인스턴스보다 2.91배에서 5.87배 높게 나타난다.
  • 콜모고로프-스미르노프 검정을 통해 오염된 인스턴스와 오염되지 않은 인스턴스 간의 적대적 점수 차이가 통계적으로 유의미함을 확인하였으며, p-value = 0.0이다.
  • 다양한 오토인코더 아키텍처 간에 흰색 상자 공격의 이동성이 낮게 나타나, 공격 이동성에 대한 내재적 강건성이 있음을 시사한다.
  • 공격자가 방어 메커니즘을 완전히 알고 있는 상황에서도 이 방법은 효과적으로 작동함을 보이며, 흰색 상자 위협에 대한 강력한 저항성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.