Skip to main content
QUICK REVIEW

[논문 리뷰] Robustness to Adversarial Examples through an Ensemble of Specialists

Mahdieh Abbasi, Christian Gagné|arXiv (Cornell University)|2017. 02. 22.
Adversarial Robustness in Machine Learning인용 수 18
한 줄 요약

이 논문은 적대적 예제에 대한 강건성을 향상시키기 위해 적대적 혼동 행렬에서 유도된 혼동이 일어나기 쉬운 클래스 부분집합에 대해 전문화된 CNN을 훈련시키고, 낮은 신뢰도 예측을 거부하는 투표 기반 메커니즘을 사용하는 전문가+1 앙상블 방법을 제안한다. 이 방법은 잘못 분류된 예측을 낮은 신뢰도로 이동시켜, 최적의 임계값에서 깨끗한 샘플의 정확도를 훼손하지 않으면서도 효과적으로 거부할 수 있도록 하여 적대적 오차율을 크게 감소시킨다.

ABSTRACT

We are proposing to use an ensemble of diverse specialists, where speciality is defined according to the confusion matrix. Indeed, we observed that for adversarial instances originating from a given class, labeling tend to be done into a small subset of (incorrect) classes. Therefore, we argue that an ensemble of specialists should be better able to identify and reject fooling instances, with a high entropy (i.e., disagreement) over the decisions in the presence of adversaries. Experimental results obtained confirm that interpretation, opening a way to make the system more robust to adversarial examples through a rejection mechanism, rather than trying to classify them properly at any cost.

연구 동기 및 목표

  • 사람의 눈으로는 인식할 수 없지만 잘못 분류를 유도하는 적대적 예제에 대한 딥 네URAL 네트워크의 취약성을 해결하기 위해.
  • 일반적인 적대적 훈련의 한계를 극복하기 위해, 이는 종종 깨끗한 정확도를 떨어뜨리고 새로운 종류의 적대적 공격에 대해서는 실패하기 때문이다.
  • 적대적 예제 탐지 문제를 개방 집합 인식 문제로 재정의하기 위해, 알려지지 않은 또는 속임수를 가진 입력은 잘못 분류하는 대신 거부되어야 한다.
  • 적대적 혼동 패턴에서 유도된 클래스 부분집합에 대해 훈련된 전문가 앙상블을 구성하여, 속임수를 가진 인스턴스 탐지 능력을 향상시키고, 강건성을 향상시키기 위해.

제안 방법

  • 빠른 기울기 부호(Fast Gradient Sign, FGS) 적대자에 대한 혼동 행렬에서 유도된 클래스 부분집합에 대해 전문가를 훈련시키며, 각 부분집합은 주어진 클래스에 대해 최소 80%의 혼동을 커버한다.
  • 혼동 행렬 기반의 부분집합 선택은 각 원본 클래스에 대해 '혼동되는 대상 클래스'(U_i)와 나머지 클래스(U_{i+K})를 식별한다.
  • K개의 전문가(각각의 클래스에 대해 하나)와 모든 클래스에 대해 훈련된 일반적인 전문가 CNN으로 구성된 앙상블이 포함된다.
  • 투표 기반 메커니즘을 통해 최종 예측을 계산한다: 만약 어떤 클래스가 최대 예상 투표 수(K+1)를 확보하면, 해당 클래스의 전문가와 일반 전문가만 사용되며, 그렇지 않으면 모든 모델이 기여한다.
  • 신뢰도 임계값을 사용하여 낮은 신뢰도 예측을 거부한다 — 특히 적대적 예제에 대해 유용하며, 이로 인해 오차율이 감소한다.
  • 투표 과정에서의 모델 불일치(높은 엔트로피)를 적대적 입력 탐지 신호로 활용하여, 잘못 분류하는 대신 거부할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1혼동 행렬에서 유도된 클래스 부분집합에 대해 훈련된 전문가 앙상블은 일반 CNN과 순수 앙상블에 비해 적대적 예제에 대해 더 강건한가?
  • RQ2신뢰도 기반 거부를 포함한 제안된 투표 기반 메커니즘은 깨끗한 샘플의 정확도를 유지하면서 적대적 입력을 효과적으로 탐지하고 거부하는가?
  • RQ3전문가+1 앙상블은 MNIST 및 CIFAR-10에서 다양한 종류의 적대자(예: FGS, DeepFool, Szegedy)에 대해 오차율을 어느 정도 감소시키는가?
  • RQ4예측 신뢰도 기반으로 거부 메커니즘이 적대적 예제와 깨끗한 샘플을 얼마나 잘 구분하는가?
  • RQ5이전 방법이 식별하지 못하는 어려운 적대자(예: FGS 및 DeepFool에서 유도된)를 이 방법은 탐지할 수 있는가?

주요 결과

  • 전문가+1 앙상블은 난이도 높은 CNN*와 순수 앙상블에 비해 적대적 오차율(E_A)을 더 크게 감소시키며, 특히 신뢰도 임계값 τ = 0.5에서 효과적인 낮은 신뢰도 예측 거부 덕분이다.
  • τ = 0.5일 때 FGS 및 DeepFool 적대자에 대해 전문가+1 앙상블의 오차율이 급격히 감소하여, 대부분의 잘못 분류된 적대적 예측이 낮은 신뢰도로 이동하고 거부된다는 것을 시사한다.
  • 전문가+1 모델에서 τ = 0.5일 때 적대자에 대한 거부율이 급격히 증가하여 빠르게 높은 수준에 도달하지만, 순수 앙상블은 느리고 단조롭게 증가한다.
  • 깨끗한 샘플 오차율(E_D)은 τ = 0.5일 때 약간 증가한다. 이는 일부 높은 신뢰도의 깨끗한 샘플이 거부되기 때문이다. 그러나 이는 더 높은 임계값을 사용함으로써 관리 가능한 수준이다.
  • Szegedy 적대자에 대해서는 일반화 능력이 낮고, 전문가+1 앙상블은 τ = 0.5를 초과해도 E_A 증가가 최소한으로 유지되어 전이 가능한 공격에 대해 강건함을 보인다.
  • 이 방법은 FGS 및 DeepFool과 같이 이전 방법이 식별하지 못하는 어려운 적대적 예제를 성공적으로 탐지하고 거부하며, 이전 방법이 실패하는 경우에도 성능을 뛰어넘는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.