Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting Backdoors in Neural Networks Using Novel Feature-Based Anomaly Detection

Hao Fu, Akshaj Kumar Veldanda|arXiv (Cornell University)|2020. 11. 04.
Adversarial Robustness in Machine Learning참고 문헌 39인용 수 11
한 줄 요약

이 논문은 신경망 내의 백도어를 탐지하기 위해 내부 구조가 아닌 입력-특징-출력 행동을 분석하는 새로운 특징 기반 이상 탐지 방어 기법을 제안한다. 이 기법은 두 가지 상호보완적인 탐지기—신규 특징과 비정상적인 특징-출력 매핑—을 사용하여 다양한 백도어 모델에서 청소된 정확도(>95%)와 거의 0%에 가까운 공격 성공률(<1%)을 달성한다. 이는 도메인 시프트와 인식 불가능한 트리거 조건에서도 성립한다.

ABSTRACT

This paper proposes a new defense against neural network backdooring attacks that are maliciously trained to mispredict in the presence of attacker-chosen triggers. Our defense is based on the intuition that the feature extraction layers of a backdoored network embed new features to detect the presence of a trigger and the subsequent classification layers learn to mispredict when triggers are detected. Therefore, to detect backdoors, the proposed defense uses two synergistic anomaly detectors trained on clean validation data: the first is a novelty detector that checks for anomalous features, while the second detects anomalous mappings from features to outputs by comparing with a separate classifier trained on validation data. The approach is evaluated on a wide range of backdoored networks (with multiple variations of triggers) that successfully evade state-of-the-art defenses. Additionally, we evaluate the robustness of our approach on imperceptible perturbations, scalability on large-scale datasets, and effectiveness under domain shift. This paper also shows that the defense can be further improved using data augmentation.

연구 동기 및 목표

  • 학습 데이터에 접근할 수 없거나 수작업 검토가 어려울 정도로 큰 경우에도 중요한 보안 위험인 신경망 백도어 공격을 해결한다.
  • 트리거 크기, 형태, 위치에 대한 제한적인 가정에 의존하는 기존 방어 기법의 한계를 극복한다.
  • 내부 구조가 아닌 특징 및 출력 수준에서 작동하므로 신경망 외부의 응용에도 적용 가능하도록 방어 기법을 개발한다.
  • 인식 불가능한 변형, 도메인 시프트, 대규모 데이터셋(예: ImageNet)에서의 확장성에 대비한 강건성을 확보한다.
  • 인간 레이블이 부여된 오염된 샘플을 활용한 데이터 증강 및 재학습을 통해 탐지 성능을 향상시킨다.

제안 방법

  • 백도어 트리거가 특징 추출 레이어에 도입하는 비정상적인 특징을 식별하기 위해 청소된 검증 데이터로 신규성 탐지기(Anomaly Detector)를 학습한다.
  • 정상적인 특징-출력 매핑을 모델링하기 위해 청소된 검증 데이터로 별도의 분류기(classifier)를 학습한다. 이는 이상 탐지 기준으로 사용된다.
  • 오염된 네트워크의 실제 특징-출력 매핑을 기준 분류기와 비교하여 비정상적인 예측을 탐지한다.
  • 이중 단계 탐지 메커니즘을 적용한다. 첫 번째 단계에서 비정상적인 특징을 가진 입력을 선별하고, 두 번째 단계에서 출력 매핑이 정상 행동에서 벗어나는지 확인한다.
  • 청소된 검증 데이터에 데이터 증강(예: 가우시안 노이즈)을 적용하여 강건성을 향상시키고 공격 성공률을 낮춘다.
  • 검출된 오염된 입력의 소수(10–20%)를 활용해 분류기를 재학습하여 공격 성공률을 더욱 낮추면서도 높은 청소된 정확도를 유지한다.

실험 결과

연구 질문

  • RQ1트리거의 크기, 형태, 위치와 같은 특성에 대한 사전 지식 없이도 백도어 탐지 기법이 효과적으로 작동할 수 있는가?
  • RQ2도메인 시프트와 인식 불가능한 변형 조건 하에서 이 기법의 성능은 어떠한가?
  • RQ3제한된 청소된 검증 데이터로도 ImageNet과 같은 대규모 데이터셋에 대해 확장 가능한가?
  • RQ4데이터 증강과 재학습을 통해 탐지 강건성 향상과 공격 성공률 감소에 어느 정도 기여하는가?
  • RQ5다양한 백도어 변종에 대해 최신 기술 대비 청소된 정확도 및 백도어 탐지 정확도 측면에서 뛰어난 성능을 보이는가?

주요 결과

  • 모든 평가된 오염된 모델에서 청소된 정확도가 95% 이상, 공격 성공률가 1% 이하로 달성되었으며, 최신 기술을 피할 수 있는 모델들 역시 포함되어 있다.
  • 데이터 증강을 적용한 결과, 공격 성공률가 6% 이하로 감소했고(대부분의 경우 1% 이하), 청소된 정확도는 약간 감소하는 데 그쳤다.
  • 검출된 오염된 입력의 10–20%를 활용해 분류기를 재학습함으로써 공격 성공률가 거의 0% 수준(예: 0.07%에서 0.35%)으로 떨어졌고, 청소된 정확도도 향상되었다.
  • 원래 검증 데이터의 50%만으로도 기법이 효과를 유지하지만, 더 작은 데이터셋일 경우 성능이 약간 저하된다.
  • ImageNet에서 학습 데이터의 8%를 검증 데이터로 사용한 경우, 재학습 후 약 63%의 청소된 정확도와 0.14%의 공격 성공률을 달성했다.
  • 이 방어 기법은 도메인 시프트와 인식 불가능한 변형에 강건하며, 다양한 백도어 트리거 유형과 임베딩 방법에 대해 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.