Skip to main content
QUICK REVIEW

[논문 리뷰] Using Non-invertible Data Transformations to Build Adversarial-Robust Neural Networks

Qinglong Wang, Wenbo Guo|arXiv (Cornell University)|2016. 10. 06.
Adversarial Robustness in Machine Learning참고 문헌 33인용 수 9
한 줄 요약

이 논문은 딥 네ural 네트워크에서의 적대적 로버스트성을 향상시키기 위해, DLM 및 DrLIM를 활용한 차원 축소를 통해 비가역적 데이터 변환을 적용하는 새로운 방어 프레임워크를 제안한다. 이 방법은 특징 복원이 불가능하게 만들어 적대적 예제를 만드는 것을 어렵게 하여, 최신 기법들과 비교해 정확도 저하를 최소화하면서도 뛰어난 로버스트성을 달성한다.

ABSTRACT

Deep neural networks have proven to be quite effective in a wide variety of machine learning tasks, ranging from improved speech recognition systems to advancing the development of autonomous vehicles. However, despite their superior performance in many applications, these models have been recently shown to be susceptible to a particular type of attack possible through the generation of particular synthetic examples referred to as adversarial samples. These samples are constructed by manipulating real examples from the training data distribution in order to "fool" the original neural model, resulting in misclassification (with high confidence) of previously correctly classified samples. Addressing this weakness is of utmost importance if deep neural architectures are to be applied to critical applications, such as those in the domain of cybersecurity. In this paper, we present an analysis of this fundamental flaw lurking in all neural architectures to uncover limitations of previously proposed defense mechanisms. More importantly, we present a unifying framework for protecting deep neural models using a non-invertible data transformation--developing two adversary-resilient architectures utilizing both linear and nonlinear dimensionality reduction. Empirical results indicate that our framework provides better robustness compared to state-of-art solutions while having negligible degradation in accuracy.

연구 동기 및 목표

  • 딥 네URAL 네트워크의 기본적인 취약성인, 모델의 해석 가능성과 특징 중요도를 악용하는 적대적 예제 문제를 해결하기 위해.
  • 기존의 방어 기법인 적대적 훈련과 지식 정복이 새로운 공격이나 적응형 공격에 대해 실패하는 한계를 극복하기 위해.
  • 정상 입력에 대한 모델 정확도를 떨어뜨리지 않으면서도, 가역적 공격의 계산 복잡도를 증가시키는 방어 프레임워크를 설계하기 위해.
  • 비가역적 변환을 사용한 통합 아키텍처를 개발하여 공격자가 입력 특징을 재구성하거나 모델 특화의 적대적 예제를 만드는 것을 방지하기 위해.
  • 비가역적 차원 축소가 청소년 데이터에서 높은 정확도를 유지하면서도 로버스트성을 향상시킨다는 것을 경험적으로 검증하기 위해.

제안 방법

  • DNN에 입력 데이터를 공급하기 전에 DLM(Discriminant LDA-based Mapping)와 DrLIM(Dimensionality Reduction with Locality-Inducing Maps)를 사용한 비가역적 차원 축소를 적용한다.
  • 고차원 샘플 간의 유사성을 저차원 공간에서 유지하는 선형 및 비선형 차원 축소 기법을 사용하여, 적대적 편향이 더 쉽게 탐지되도록 한다.
  • 변환이 비가역적이게 보장하여 공격자가 원래 특징을 재구성하거나 보조 모델을 통해 특징 중요도 분석을 수행하는 것을 방지한다.
  • 차원 축소 모듈을 DNN 아키텍처의 전처리 레이어로 통합하여, 변환 후 분류를 수행하는 두 단계 시스템을 구성한다.
  • 비가역 매핑이 특징 수준 분석을 흐리게 하여, 공격자가 기울기 기반 또는 대체 모델 공격을 사용하는 것을 불가능하게 한다.
  • 표준 백프로파게이션을 사용해 변환된 데이터로 DNN을 훈련시켜 청소년 데이터에서 높은 정확도를 유지하면서도 적대적 예제에 대한 로버스트성을 향상시킨다.

실험 결과

연구 질문

  • RQ1비가역적 데이터 변환은 청소년 정확도를 떨어뜨리지 않으면서도 적대적 예제를 만드는 데서 상당한 난이도를 증가시키는가?
  • RQ2국소 유사성을 유지하는 차원 축소는 적대적 편향에 대한 로버스트성을 향상시키는가?
  • RQ3비가역적 변환 기반 방어 메커니즘이 보조 모델을 사용한 특징 중요도 분석을 방지할 수 있는가?
  • RQ4제안된 프레임워크는 적대적 훈련과 지식 정복과 비교해 볼 때, 예상치 못한 적대적 공격에 대해 더 높은 로버스트성을 보이는가?
  • RQ5특징 복원을 계산적으로 불가능하게 만들어 비가역적 변환을 통해 공격에 대해 증명 가능하게 강건한 방어를 설계할 수 있는가?

주요 결과

  • 제안된 프레임워크는 MNIST 데이터셋에서 최신 기법들과 비교해 상당히 낮은 오류율을 달성한다.
  • 청결한(비적대적) 데이터에 대해 거의 동일한 정확도를 유지하며, 미미한 정확도 저하 외에는 영향을 주지 않는다.
  • 변환된 모델을 대상으로 만든 적대적 예제는 훨씬 더 큰 편향을 요구하여 더 쉽게 탐지 가능하다.
  • 이론적 분석에 따르면, 두 번째 아키텍처(즉, DrLIM 기반)에서는 공격자가 유효한 적대적 예제를 만들 수 없으며, 이는 변환이 비가역적이기 때문이다.
  • 기존의 방법들인 적대적 훈련과 지식 정복은 여전히 공격자가 모델의 구조와 기울기를 악용해 적대적 예제를 생성할 수 있기 때문에 충분하지 않다.
  • DLM과 DrLIM는 모두 비가역적이며, 계산적으로 효율적이며, 중요한 특징과 유사성 정보를 유지하므로 이 방어 프레임워크에 이상적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.