Skip to main content
QUICK REVIEW

[논문 리뷰] Practical Detection of Trojan Neural Networks: Data-Limited and Data-Free Cases

Ren Wang, Gaoyuan Zhang|arXiv (Cornell University)|2020. 07. 31.
Adversarial Robustness in Machine Learning참고 문헌 42인용 수 20
한 줄 요약

이 논문은 모델 가중치만을 사용하고 최소 또는 전혀 데이터가 없는 조건에서 타격을 입힌 신경망을 탐지하는 두 가지 새로운 트로이 목표 신경망 탐지 방법을 제안한다: 데이터 제한적 TND(DL-TND)와 데이터 없음 TND(DF-TND). DL-TND는 소수의 정상 검증 샘플에 대해 개별 샘플 및 유니버설(adversarial) 공격 패턴을 활용하며, DF-TND는 무작위 노이즈 입력에 대한 뉴런 활성화 반응을 통해 트로이 목표를 탐지한다. 이는 다양한 모델과 데이터셋에서 0.99 AUROC를 달성한다.

ABSTRACT

When the training data are maliciously tampered, the predictions of the acquired deep neural network (DNN) can be manipulated by an adversary known as the Trojan attack (or poisoning backdoor attack). The lack of robustness of DNNs against Trojan attacks could significantly harm real-life machine learning (ML) systems in downstream applications, therefore posing widespread concern to their trustworthiness. In this paper, we study the problem of the Trojan network (TrojanNet) detection in the data-scarce regime, where only the weights of a trained DNN are accessed by the detector. We first propose a data-limited TrojanNet detector (TND), when only a few data samples are available for TrojanNet detection. We show that an effective data-limited TND can be established by exploring connections between Trojan attack and prediction-evasion adversarial attacks including per-sample attack as well as all-sample universal attack. In addition, we propose a data-free TND, which can detect a TrojanNet without accessing any data samples. We show that such a TND can be built by leveraging the internal response of hidden neurons, which exhibits the Trojan behavior even at random noise inputs. The effectiveness of our proposals is evaluated by extensive experiments under different model architectures and datasets including CIFAR-10, GTSRB, and ImageNet.

연구 동기 및 목표

  • 학습 데이터에 접근할 수 없거나 제한된 조건에서 트로이 목표 신경망을 탐지하는 데 도전하는 것.
  • 제한된 데이터, 트리거 지식이 없고 모델 아키텍처와 공격 유형에 유연한 가정을 만족하는 탐지 프레임워크를 개발하는 것.
  • 데이터 프라이버시나 액세스 제약으로 인해 원본 데이터셋을 전체적으로 사용할 수 없는 실세계 배포 환경에서 실용적인 트로이 목표 탐지를 가능하게 하는 것.
  • 대규모 학습 데이터, 트리거 복구, 모델 재학습이 필요한 기존 방법의 한계를 극복하는 것.
  • 근접 최적화 알고리즘을 사용해 데이터 제한적 및 데이터 없음 탐지에 통합된 최적화 프레임워크를 제공하는 것.

제안 방법

  • 트로이 공격과 두 가지 유형의 적대적 공격(개별 샘플 적대적 공격 및 전 샘플 유니버설 공격) 간의 연결 고리를 활용해 DL-TND를 설계한다.
  • 소수의 정상 검증 샘플(클래스당 하나)만 존재하는 데이터 제한 설정에서, 적대적 공격에 의해 생성된 입력 변형을 탐지 신호로 사용한다.
  • 모든 데이터 샘플이 없이도 뉴런 활성화 패턴을 분석하여 트로이 목표를 탐지하기 위해 DF-TND를 개발한다. 이는 무작위 노이즈 입력에 대한 반응을 통해 숨겨진 트로이 목표 행동을 드러낸다.
  • 특히, 무작위 입력 조건에서도 트리거 패턴에 민감한 은닉 뉴런의 내부 반응을 활용해 트로이 목표 존재 여부를 식별한다.
  • 양측 탐지기 모두를 안정적이고 효율적인 학습을 보장하기 위해 통합된 근접 최적화 프레임워크 내에 수식화한다.
  • 원본 학습 데이터에 의존하지 않고, 소수의 정상 검증 샘플(DF-TND의 경우 무작위 노이즈)을 사용해 탐지 모델을 학습시킨다.

실험 결과

연구 질문

  • RQ1클래스당 하나의 정상 검증 샘플만 존재할 때 트로이 목표 신경망을 신뢰성 있게 탐지할 수 있는가?
  • RQ2학습 또는 검증 데이터에 접근하지 않고도 모델 가중치와 내부 뉴런 반응만으로 트로이 목표를 탐지할 수 있는가?
  • RQ3다양한 모델 아키텍처(VGG16, ResNet-50, AlexNet 등)와 데이터셋(CIFAR-10, GTSRB, ImageNet 등)에서 탐지 프레임워크의 효과는 어떠한가?
  • RQ4트리거 패턴에 대한 사전 지식 없이도 다양한 트로이 공격 유형(예: 클린라벨 공격)을 탐지할 수 있는가?
  • RQ5다양한 오염 비율과 공격 성공률에서 탐지 성능는 어떻게 변하는가?

주요 결과

  • DL-TND는 클래스당 하나의 정상 샘플만 존재하는 조건에서 여러 데이터셋과 모델 아키텍처에서 평균 AUROC 0.99를 달성한다.
  • DF-TND는 무작위 노이즈만을 입력으로 사용해 0.99 AUROC를 달성했으며, 이는 트로이 목표 행동이 입력 데이터와 무관하게 뉴런 활성화 패턴에 내장되어 있음을 시사한다.
  • 공격 성공률이 30%에 불과하고 오염 비율이 0.5%일 때조차도 DL-TND와 DF-TND 모두 높은 탐지 성능(AUROC ≥ 0.99)을 유지한다.
  • 오직 55개 모델 중 5개만 오염된 저자료 환경에서, 두 탐지기는 정밀도-재현율 곡선에서 AUC 0.97, ROC 곡선에서 AUC 0.99를 기록한다.
  • DF-TND는 트리거 패턴이나 학습 데이터 없이도 클린라벨 공격 하에서 트로이넷을 0.92 AUROC로 성공적으로 탐지한다.
  • 이 방법은 무작위 노이즈에 대한 뉴런 반응에서 트리거 패턴을 재구성할 수 있음을 드러내며, 트로이 목표 행동이 모델의 내부 표현에 코딩되어 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.