Skip to main content
QUICK REVIEW

[논문 리뷰] DeepCloak: Masking Deep Neural Network Models for Robustness Against Adversarial Samples

Ji Gao, Beilun Wang|arXiv (Cornell University)|2017. 02. 22.
Adversarial Robustness in Machine Learning참고 문헌 12인용 수 72
한 줄 요약

DeepCloak은 DNN에 이진 마스크 계층을 추가하여 불필요한 특징을 제거하고, 정상 정확도에 미치는 영향은 최소화하며 적대적 취약성을 감소시킵니다.

ABSTRACT

Recent studies have shown that deep neural networks (DNN) are vulnerable to adversarial samples: maliciously-perturbed samples crafted to yield incorrect model outputs. Such attacks can severely undermine DNN systems, particularly in security-sensitive settings. It was observed that an adversary could easily generate adversarial samples by making a small perturbation on irrelevant feature dimensions that are unnecessary for the current classification task. To overcome this problem, we introduce a defensive mechanism called DeepCloak. By identifying and removing unnecessary features in a DNN model, DeepCloak limits the capacity an attacker can use generating adversarial samples and therefore increase the robustness against such inputs. Comparing with other defensive approaches, DeepCloak is easy to implement and computationally efficient. Experimental results show that DeepCloak can increase the performance of state-of-the-art DNN models against adversarial samples.

연구 동기 및 목표

  • 불필요한 특징에 대한 의존도를 줄여 DNN에서 적대적 샘플에 대한 강인성을 유도한다.
  • 재학습이 필요하지 않고 기존 DNN에 적용할 수 있는 경량 방어책을 제안한다.
  • 적대적 섭동에 가장 민감한 특징을 식별하고 제거하여 공격 벡터를 제한한다.

제안 방법

  • 정상 입력과 적대적 입력에서의 활성화를 비교하여 특징 민감도를 계산한다.
  • 분류기 앞에 0 또는 1의 가중치를 가진 마스크 계층을 삽입하여 상위 m%의 가장 민감한 특징을 제거한다.
  • 마스크는 적대적 쌍 간의 각 특징 변화의 누ého로 학습된다( v = sum_i |g(x_i) - g(x'_i)| ).
  • 민감도 벡터의 상위 m개의 원소를 0으로, 남은 원소를 1로 설정한 뒤 마스크를 DNN에 삽입한다.
  • 재학습은 필요하지 않으며, 효율성을 위해 학습 마스크는 훈련 데이터의 일부를 사용할 수 있다.
  • 일반성을 보여주기 위해 다양한 아키텍처에 적용한다.

실험 결과

연구 질문

  • RQ1재학습 없이 불필요한 특징을 마스킹하는 것이 DNN의 적대적 입력에 대한 강인성을 개선할 수 있는가?
  • RQ2의미 있는 적대적 강인성을 달성하기 위해 어떤 비율의 특징을 마스킹해야 하는가?
  • RQ3아키텍처에 따라 깨끗한(비적대적) 데이터에서의 정확도에 특징 마스킹이 어떤 영향을 미치는가?

주요 결과

  • 적은 비율의 특징을 마스킹하는 것이 적대적 정확도에서 두드러진 이득을 산출한다. 256 특징 노드를 갖는 ResNet의 경우, 1% 마스킹으로 적대적 정확도는 0.3923이고 상대 증가율은 32.49%이다.
  • 더 많은 특징을 제거하면 점진적으로 적대적 강인성이 증가하지만 깨끗한 정확도는 감소할 수 있다; 트레이드오프는 비교적 큰 적대적 이득을 얻도록 작은 백분율의 마스킹을 선호한다.
  • CIFAR-10에서 CNN, VGG, Wide ResNet에 걸쳐 최대 10%의 특징 마스킹은 점진적으로 더 높은 적대적 정확도를 달성하며 정상 정확도의 하락은 상대적으로 완만하다.
  • 본 연구는 많은 특징이 적대적 샘플 생성에 대해 중요하지 않음을 보여주어 선택적 특징 제거를 효과적인 방어로 뒷받침한다.
  • 1%의 특징을 마스킹하는 것이 자주 강인성에서 상당한 증가를 제공하며 깨끗한 데이터에서 높은 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.