[논문 리뷰] Cassandra: Detecting Trojaned Networks from Adversarial Perturbations
이 논문은 적대적 편향과 공격의 어려움을 분석하여 트로이 목표 신경망을 탐지하는 딥러닝 기반 방법인 Cassandra를 제안한다. MNIST 및 NIST 데이터셋에서 트리거나 대상 클래스에 대한 사전 지식 없이도, 92% 이상의 정확도로 모델을 정상 또는 트로이 목표로 분류하는 이중 스트림 신경망을 사용한다.
Deep neural networks are being widely deployed for many critical tasks due to their high classification accuracy. In many cases, pre-trained models are sourced from vendors who may have disrupted the training pipeline to insert Trojan behaviors into the models. These malicious behaviors can be triggered at the adversary's will and hence, cause a serious threat to the widespread deployment of deep models. We propose a method to verify if a pre-trained model is Trojaned or benign. Our method captures fingerprints of neural networks in the form of adversarial perturbations learned from the network gradients. Inserting backdoors into a network alters its decision boundaries which are effectively encoded in their adversarial perturbations. We train a two stream network for Trojan detection from its global ($L_\infty$ and $L_2$ bounded) perturbations and the localized region of high energy within each perturbation. The former encodes decision boundaries of the network and latter encodes the unknown trigger shape. We also propose an anomaly detection method to identify the target class in a Trojaned network. Our methods are invariant to the trigger type, trigger size, training data and network architecture. We evaluate our methods on MNIST, NIST-Round0 and NIST-Round1 datasets, with up to 1,000 pre-trained models making this the largest study to date on Trojaned network detection, and achieve over 92\% detection accuracy to set the new state-of-the-art.
연구 동기 및 목표
- 실세계 배포 환경에서 백도ored 사전 훈련된 딥 뉴럴 네트워크가 초래하는 심각한 보안 위협을 해결한다.
- 트리거 정보나 광범위한 훈련 데이터가 제공되지 않을 경우 트로이 목표를 탐지하는 데 도전하는 문제를 해결한다.
- 단지 몇 개의 정상 샘플만을 사용하여도 확장 가능하고 아키텍처에 종속되지 않는 모델 무결성 검증 방법을 개발한다.
- 트로이 목표 모델의 대상 클래스를 탐지할 수 있도록 하여 악성 행동을 이해하는 데 필수적인 요소를 확보한다.
- 트리거 유형, 크기, 모델 아키텍처에 관계없이 불변하는 강력하고 일반화 가능한 탐지 프레임워크를 구축한다.
제안 방법
- 모델의 전반적인 결정 경계 지문을 포착하기 위해 일반화된 $L_\infty$ 및 $L_2$ 유계 적대적 편향을 생성한다.
- 편향 내 국소적으로 에너지가 높은 영역을 식별하여 알려지지 않은 트리거 형태를 인코딩한다.
- 전반적인 편향 특징과 국소 에너지 패턴을 융합하는 이중 스트림 신경망을 훈련하여 트로이 목표 탐지에 사용한다.
- 모델을 속이는데 필요한 최소한의 편향 에너지를 수량화하는 새로운 지표인 공격 어려움 $\gamma$를 도입하며, 이를 핵심 식별자로 사용한다.
- $\gamma$와 예측된 트로이 목표 확률을 이중 단계 파이프라인에 활용하여 트로이 목표 모델의 대상 클래스를 예측한다.
- MNIST 및 NIST 데이터셋의 1,000개의 사전 훈련된 모델을 포함한 대규모 데이터셋을 활용하여 탐지 네트워크를 훈련하고 검증한다.
실험 결과
연구 질문
- RQ1적대적 편향이 사전 훈련된 딥 뉴럴 네트워크의 백도어를 탐지하는 데 신뢰할 수 있는 지문으로 기능할 수 있는가?
- RQ2트리거나 훈련 데이터 지식 없이도 모델에 종속되지 않는 탐지 방법을 어떻게 설계할 수 있는가?
- RQ3공격 어려움 $\gamma$가 트로이 목표 모델의 대상 클래스를 효과적으로 나타낼 수 있는가?
- RQ4트리거 유형, 크기, 네트워크 아키텍처의 변화에 대해 탐지 방법이 얼마나 강건한가?
- RQ5정상 및 트로이 목표 모델의 대규모 데이터셋에서 훈련된 딥러닝 기반 탐지기가 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- Cassandra는 다중 배치 편향과 이중 스트림 아키텍처를 사용하여 NIST-Round0 데이터셋에서 92.5%의 탐지 정확도를 달성한다.
- 예측된 트로이 목표 확률과 공격 어려움을 사용할 경우, 트리거가 삽입된 MNIST 데이터셋에서 대상 클래스 예측 정확도가 기준값 76.1%에서 90.0%로 향상된다.
- 진정된 트로이 목표 확률을 사용하면 NIST-Round0에서 탐지 정확도가 95.0%로 상승하여 $\gamma$가 대상 클래스를 나타내는 핵심 지표임을 확인한다.
- 편향 생성의 하이퍼파rameter 변화에 대해 강건하며, 다양한 $L_\infty$ 및 $L_2$ 설정에서 탐지 정확도가 5% 이내로 변동한다.
- 제거 분석 결과, 서로 다른 데이터 배치에서 생성한 다수의 편향을 사용할 경우 정확도가 77.5%에서 92.5%로 향상되어 다중 배치 분석의 가치를 입증한다.
- 이 방법은 1,000개의 사전 훈련된 모델을 대상으로 한 최대 규모의 평가에서 이전 방법을 능가하며, 트로이 목표 탐지 분야에서 새로운 최고 기록을 수립한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.