Skip to main content
QUICK REVIEW

[논문 리뷰] The Adversarial Attack and Detection under the Fisher Information Metric

Chenxiao Zhao, P. Thomas Fletcher|arXiv (Cornell University)|2018. 10. 09.
Adversarial Robustness in Machine Learning참고 문헌 27인용 수 5
한 줄 요약

이 논문은 정보기하학에서 피셔 정보 계량형식(Fisher information metric, FIM)을 사용하여 적대적 공격과 탐지의 통합 프레임워크를 제안한다. 일단의 스펙트럼 공격(One-step Spectral Attack, OSSA)을 도입하여, 적대적 편향은 FIM의 최상위 고유벡터에서 유도하고, 이에 대응하는 고유값을 강건한 탐지 모델의 특징으로 사용한다. 이 방법은 최첨단 탐지 성능을 달성하며, 자체 공격에 의해 생성된 적대적 예제에서 기준 방법 대비 AUC 점수 최대 7.16% 높게 기록한다.

ABSTRACT

Many deep learning models are vulnerable to the adversarial attack, i.e., imperceptible but intentionally-designed perturbations to the input can cause incorrect output of the networks. In this paper, using information geometry, we provide a reasonable explanation for the vulnerability of deep learning models. By considering the data space as a non-linear space with the Fisher information metric induced from a neural network, we first propose an adversarial attack algorithm termed one-step spectral attack (OSSA). The method is described by a constrained quadratic form of the Fisher information matrix, where the optimal adversarial perturbation is given by the first eigenvector, and the model vulnerability is reflected by the eigenvalues. The larger an eigenvalue is, the more vulnerable the model is to be attacked by the corresponding eigenvector. Taking advantage of the property, we also propose an adversarial detection method with the eigenvalues serving as characteristics. Both our attack and detection algorithms are numerically optimized to work efficiently on large datasets. Our evaluations show superior performance compared with other methods, implying that the Fisher information is a promising approach to investigate the adversarial attacks and defenses.

연구 동기 및 목표

  • 정보기하학을 활용해 딥 네ural 네트워크의 적대적 공격에 대한 본질적 기하학적 취약성을 이해하기 위해.
  • 피셔 정보 행렬(Fisher information matrix, FIM)을 활용해 최적의 편향을 식별하는 새로운 적대적 공격 방법을 개발하기 위해.
  • FIM의 고유값을 적대적 예제를 탐지하기 위한 내재적 특징으로 활용하기 위해.
  • 대규모 데이터셋에 스케일링 가능한 효율적이고 수치 최적화된 알고리즘을 설계하기 위해.
  • 다양한 공격 유형에 걸쳐 탐지 방법의 일반화 능력을 입증하기 위해.

제안 방법

  • 최적의 편향이 FIM의 첫 번째 고유벡터에 해당하는, 피셔 정보 행렬(FIM)에 대한 제약 조건이 있는 이차 최적화 문제로 적대적 공격를 수식화한다.
  • FIM의 고유값을 국소 모델의 취약도 측정 기준으로 사용하며, 높은 고유값은 해당 고유벡터 방향으로의 적대적 편향에 대한 더 높은 취약도를 나타낸다.
  • CIFAR-10 및 MNIST와 같은 대규모 데이터셋에서 FIM과 그 고유벡터를 효율적으로 계산하기 위해 수치 최적화 기법을 적용한다.
  • 네트워크를 속이는 데 필요한 최소 편향 크기를 찾기 위해 이진 검색을 사용하며, 고유값 기반의 취약도 특성화를 검증한다.
  • 상위 20개 고유값을 특징으로 하여 랜덤 포레스트 또는 나이브 베이즈 분류기를 훈련시켜 적대적 입력을 탐지한다.
  • 충분통계량에 대해 충분히 정의된 FIM을 사용함으로써 재매개변수화에 대한 불변성을 확보한다.

실험 결과

연구 질문

  • RQ1피셔 정보 계량형식은 딥 네ural 네트워크의 적대적 공격에 대한 본질적 취약성을 어떻게 특성화할 수 있는가?
  • RQ2FIM의 고유벡터와 고유값은 더 효과적이고 기하학적으로 인지된 적대적 예제를 생성하는 데 사용될 수 있는가?
  • RQ3FIM의 고유값은 다양한 공격 유형에 걸쳐 적대적 입력을 탐지하는 데 신뢰성 있고 일반화 가능한 특징으로 기능하는가?
  • RQ4기존 방법인 커널 밀도 추정(Kernel Density Estimation, KDE)과 베이지안 불확실성(Bayesian Uncertainty, BU)에 비해 제안된 탐지 방법의 성능 및 강건성은 어떻게 비교되는가?
  • RQ5제안된 공격(OSSA)의 기하학적 최적성은 탐지 모델의 일반화 능력에 어느 정도의 영향을 미치는가?

주요 결과

  • 일단의 스펙트럼 공격(OSSA)은 FIM의 첫 번째 고유벡터를 선택하여 적대적 예제를 생성하며, 이는 피셔 계량형식 하에서 입력-출력 맵핑의 최대 곡률 방향에 해당한다.
  • FIM의 고유값은 적대적 취약도와 강하게 상관되어 있으며, 높은 고유값은 해당 고유벡터 방향으로의 편향에 대한 더 높은 취약도를 나타낸다.
  • 상위 20개 고유값을 특징으로 사용하는 제안된 탐지 방법은 OTCM 및 FGM 공격에 의해 생성된 예제에 대해 각각 AUC 점수 98.55%와 98.96%를 기록하며, KD 및 BU 기준 방법을 능가한다.
  • OSSA에 의해 생성된 적대적 예제에서, 탐지기는 KD와 BU의 조합 대비 AUC 점수를 각각 7.16%와 4.47% 높게 기록하여 뛰어난 탐지 능력을 입증한다.
  • 다양한 공격 유형으로도 일반화 능력이 뛰어나며, 단일 공격 유형으로만 훈련된 경우에도 AUC 점수가 90%를 초과한다. 다만 OSSA로 훈련된 탐지기는 그 방법의 기하학적 최적성으로 인해 약간 낮은 일반화 능력을 보인다.
  • 최대 20개의 트리와 깊이 ≤5를 가진 랜덤 포레스트 분류기는 안정된 성능을 보이며, 고유값 기반 특징의 저분산성과 강건성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.