Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting Anomalous Inputs to DNN Classifiers By Joint Statistical Testing at the Layers.

Jayaram Raghuram, Varun Chandrasekaran|arXiv (Cornell University)|2020. 07. 29.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 딥 네트워크 분류기의 내부 레이어 표현의 조건부 분포를 공동으로 테스트함으로써, 적대적 입력과 분포 외 입력(OOD)을 비지도 통계적 프레임워크로 탐지하는 방법을 제안한다. 레이어 간 p-값을 계산하고 점수 함수를 통해 통합함으로써, 높은 정확도로 이상치 입력을 식별하며, 벤치마크 데이터셋에서 다섯 개의 최신 검출 방법보다 우수하거나 동등한 성능을 보인다.

ABSTRACT

Detecting anomalous inputs, such as adversarial and out-of-distribution (OOD) inputs, is critical for classifiers deployed in real-world applications, especially deep neural network (DNN) classifiers that are known to be brittle on such inputs. We propose an unsupervised statistical testing framework for detecting such anomalous inputs to a trained DNN classifier based on its internal layer representations. By calculating test statistics at the input and intermediate-layer representations of the DNN, conditioned individually on the predicted class and on the true class of labeled training data, the method characterizes their class-conditional distributions on natural inputs. Given a test input, its extent of non-conformity with respect to the training distribution is captured using p-values of the class-conditional test statistics across the layers, which are then combined using a scoring function designed to score high on anomalous inputs. We focus on adversarial inputs, which are an important class of anomalous inputs, and also demonstrate the effectiveness of our method on general OOD inputs. The proposed framework also provides an alternative class prediction that can be used to correct the DNNs prediction on (detected) adversarial inputs. Experiments on well-known image classification datasets with strong adversarial attacks, including a custom attack method that uses the internal layer representations of the DNN, demonstrate that our method outperforms or performs comparably with five recently-proposed, competing detection methods.

연구 동기 및 목표

  • 배포된 DNN 분류기에서 적대적 및 분포 외(OOD) 입력을 탐지하는 데 있어 중요한 과제를 해결하는 것 — 이러한 입력에 대해 기존 분류기가 취약함이 알려져 있음.
  • 학습 중에 적대적 예제가 필요하지 않은 비지도 방법을 개발하여 광범위한 적용 가능성을 확보하는 것.
  • 라벨이 부여된 학습 데이터로부터 유도된 조건부 분포 통계를 사용해 자연 입력의 분포를 입력 레이어 및 중간 레이어에서 특성화하는 것.
  • 이상치 입력에 대해 높은 점수를 부여하면서도, 이상치가 탐지되었을 경우 수정된 예측을 지원할 수 있는 신뢰할 수 있는 이상치 탐지 메커니즘을 제공하는 것.
  • 내부 레이어 표현을 공격 대상으로 삼는 새로운 공격을 포함한 강력한 적대적 공격에 대한 강건성을 입증하는 것.

제안 방법

  • DNN의 입력 및 중간 레이어 표현에서 예측된 클래스와 학습 샘플의 진짜 클래스에 따라 별도로 조건부된 테스트 통계량을 계산한다.
  • 라벨이 부여된 학습 데이터를 사용해 이러한 테스트 통계량의 조건부 분포를 추정하여 자연 입력의 기대 행동을 모델링한다.
  • 테스트 입력에 대해, 레이어 전반에 걸쳐 학습된 조건부 분포와의 부합도를 반영하는 p-값을 계산한다.
  • 이상치 입력에 대한 점수를 증폭시킬 수 있도록 설계된 점수 함수를 사용해 레이어별 p-값을 통합함으로써 효과적인 탐지가 가능하도록 한다.
  • 이상치로 탐지된 입력에 대해, 동일한 통계적 프레임워크를 활용해 보조 예측 클래스를 생성함으로써 수정된 예측을 가능하게 한다.
  • 내부 레이어 표현을 공격 대상으로 삼는 맞춤형 적대적 공격을 사용해 탐지 프레임워크의 강건성을 철저히 평가한다.

실험 결과

연구 질문

  • RQ1다양한 DNN 레이어에서 동시 통계적 테스트를 수행할 경우, 단일 레이어 또는 비통계적 방법 대비 적대적 및 OOD 입력 탐지 성능이 향상되는가?
  • RQ2특히 내부 레이어 표현을 공격 대상으로 삼는 강력한 공격에 의해 생성된 적대적 예제를 탐지하는 데 제안된 방법이 얼마나 효과적인가?
  • RQ3입력이 이상치로 탐지되었을 경우, 보다 신뢰할 수 있는 보조 예측을 제공할 수 있는가? 이는 분류기의 강건성을 향상시킬 수 있는가?
  • RQ4레이어 전반에 걸쳐 조건부 통계량을 사용할 경우, 기존 비지도 접근법 대비 더 나은 일반화 및 탐지 성능를 달성하는가?
  • RQ5분포 이탈 상황에서나 적대적 예제 외 다양한 OOD 입력에 대해 이 방법은 어떻게 성능을 보이는가?

주요 결과

  • 제안된 방법은 강력한 적대적 공격 조건에서 표준 이미지 분류 벤치마크에서 다섯 개의 최근에 제안된 탐지 방법보다 우수하거나 동등한 성능을 보였다.
  • 특히 내부 레이어 표현을 공격 대상으로 삼는 맞춤형 적대적 공격에 대해서도 높은 탐지 성능를 유지하여 강건성을 입증하였다.
  • 다양한 레이어에서 조건부 통계 테스트의 p-값을 사용함으로써 자연 데이터 분포에서 벗어나는 입력을 효과적으로 탐지할 수 있었다.
  • 탐지된 적대적 입력에 대해 보조 예측을 제공함으로써, 실세계 배포 환경에서 분류기의 신뢰성 향상에 실용적인 메커니즘을 제공하였다.
  • 레이어별 p-값을 통합한 점수 함수는 이상치를 효과적으로 증폭시켜 다양한 테스트 시나리오에서 뛰어난 탐지 성능를 달성하였다.
  • 이 방법은 비지도 방식이며 학습 중에 적대적 예제가 필요하지 않아, 기존 DNN 분류기에 광범위하게 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.