Skip to main content
QUICK REVIEW

[논문 리뷰] UNICORN: A Unified Backdoor Trigger Inversion Framework

Zhenting Wang, Kai Mei|arXiv (Cornell University)|2023. 04. 05.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

UNICORN는 다양한 트리거 유형으로 일반화하는 통합된 백도어 트리거 역전환 프레임워크를 제안한다. 이는 역전환 가능한 변환을 통해 다양한 입력 공간에서의 변형으로서 트리거를 모델링함으로써 이루어지며, CIFAR-10과 ImageNet에서 여덟 가지 백도어 공격 유형에 대해 기존 방법을 능가한다. 역전환 과정에서 95% 이상의 공격 성공률를 기록했으며, 자기지도 학습 모델에도 효과적임을 입증하였다.

ABSTRACT

The backdoor attack, where the adversary uses inputs stamped with triggers (e.g., a patch) to activate pre-planted malicious behaviors, is a severe threat to Deep Neural Network (DNN) models. Trigger inversion is an effective way of identifying backdoor models and understanding embedded adversarial behaviors. A challenge of trigger inversion is that there are many ways of constructing the trigger. Existing methods cannot generalize to various types of triggers by making certain assumptions or attack-specific constraints. The fundamental reason is that existing work does not consider the trigger's design space in their formulation of the inversion problem. This work formally defines and analyzes the triggers injected in different spaces and the inversion problem. Then, it proposes a unified framework to invert backdoor triggers based on the formalization of triggers and the identified inner behaviors of backdoor models from our analysis. Our prototype UNICORN is general and effective in inverting backdoor triggers in DNNs. The code can be found at https://github.com/RU-System-Software-and-Security/UNICORN.

연구 동기 및 목표

  • 기존 트리거 역전환 방법이 정적 픽셀 공간 트리거를 전제로 하여 복잡한 트리거 유형(예: 필터나 왜곡 효과)으로의 일반화에 실패하는 한계를 해결하기 위해.
  • 역전환 가능한 변환을 사용하여 다양한 입력 공간에서의 백도어 트리거를 수학적으로 정의함으로써, 역전환 문제의 통합적 공식화를 가능하게 하기 위해.
  • 백도어가 삽입된 모델에서 정상 및 손상된 활성화 벡터가 분리되어 있음을 관찰하고, 이를 역전환의 핵심 행동적 특징으로 식별 및 활용하기 위해.
  • 공격 유형에 특화된 가정 없이, 데이터 오염 및 공급망 공격을 포함한 다양한 공격 유형의 트리거를 역전환할 수 있는 일반 목적의 프레임워크를 개발하기 위해.
  • 사전 훈련된 인코더에서 트리거를 역전환함으로써, 자기지도 학습 모델에 대한 트리거 역전환의 적용 범위를 확장하기 위해.

제안 방법

  • 백도어 트리거를 변환된 입력 공간에서의 변형으로 수식화함: $\tilde{\bm{x}} = \phi^{-1}\left((1-\bm{m})\odot\phi(\bm{x}) + \bm{m}\odot\bm{t}\right)$, 여기서 $\phi$는 역전환 가능한 변환 함수임.
  • 입력 공간 변환 $\phi$, 마스크 $\bm{m}$, 트리거 패턴 $\bm{t}$를 동시에 최적화하여 백도어를 재구성하는 제약 조건이 부여된 최적화 문제를 제안함.
  • 중간 레이어에서 손상된 활성화 벡터가 정상 벡터와 분리되어 있음을 관찰하고, 이를 통해 백도어 행동을 신뢰성 있게 탐지할 수 있음을 활용함.
  • 정규화를 통한 소형, 인지하기 어려운 트리거를 보장하면서도 기울기 기반 탐색을 사용하여 최적화 문제를 해결하는 PyTorch 기반 프로토타입인 UNICORN을 구현함.
  • 분류 손실을 회피하기 위해, 사전 훈련된 인코더에서의 트리거 임베딩과 기준 샘플 임베딩 간의 유사도를 최대화하는 방식으로 자기지도 학습 모델에 프레임워크를 적응함.
  • 자기지도 학습 모델을 평가하기 위해 기준 샘플 기반 평가 전략을 사용하며, 공격 성공률는 미세조정된 최종 분류기로 측정함.

실험 결과

연구 질문

  • RQ1공격 유형에 특화된 가정 없이도, 필터, 왜곡 효과, 패치 기반 트리거를 포함한 다양한 트리거 유형으로 일반화할 수 있는 통합된 트리거 역전환 프레임워크가 존재하는가?
  • RQ2역전환 가능한 변환을 통해 다양한 입력 공간에서 트리거를 모델링하면, 트리거 역전환의 일반화 능력과 강건성은 어떻게 향상되는가?
  • RQ3백도어가 삽입된 모델에서 분리된 활성화 패턴은 다양한 아키텍처와 데이터셋 전반에서 트리거의 신뢰성 있는 탐지 및 역전환를 얼마나 잘 가능하게 하는가?
  • RQ4제안된 프레임워크는 자기지도 학습 모델, 특히 사전 훈련된 인코더에서 트리거를 효과적으로 역전환할 수 있는가?
  • RQ5여러 데이터셋과 백도어 공격 유형에 걸쳐 UNICORN의 성능은 기존 최고 성능 방법과 비교해 어떻게 뛰어나게 나타나는가?

주요 결과

  • UNICORN은 CIFAR-10과 ImageNet에서 여덟 가지 다른 백도어 공격에 대해 평균 95.89%의 공격 성공률(ASR)을 기록하였으며, 정적 픽셀 공간 트리거를 전제로 하는 기존 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 패치 공격에서 UNICORN은 98.95%의 ASR을 기록하여 다음으로 우수한 방법보다 10个百分点 이상 높였으며, 뛰어난 역전환 정확도를 입증하였다.
  • 복잡한 왜곡 효과를 사용하는 WaNet 공격의 경우, UNICORN은 91.41%의 ASR을 기록하여 전통적이지 않은 공간 변형 트리거에 대해서도 효과적임을 보였다.
  • 자기지도 학습 환경에서는 UNICORN이 사전 훈련된 인코더에서 트리거를 평균 97.01%의 ASR로 역전환하였으며, 삽입된 트리거의 평균 성공률(97.87%)과 매우 유사한 성능를 기록하였다.
  • Badencoder에서 흰색 패치 트리거를 성공적으로 역전환하여, 원래 트리거와 동일한 공간 위치에 역전환된 트리거를 시각화함으로써 공간 정확도를 확인하였다.
  • ResNet, DenseNet, 비전 트랜스포머를 포함한 다양한 모델에서 UNICORN의 역전환 성능가 뛰어난 일반화 능력을 보이며 특정 아키텍처에 국한되지 않음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.