Skip to main content
QUICK REVIEW

[논문 리뷰] Backdoor Attacks in the Supply Chain of Masked Image Modeling

Xinyue Shen, Xinlei He|arXiv (Cornell University)|2022. 10. 04.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 최신 자기지도 학습 방법인 마스킹 이미지 모델링(MIM)의 공급망에서의 백도어 공격에 대한 첫 번째 체계적 분석을 제시한다. 공전의 새로운 트리거 기반 백도어 공격을 제안하여 사전 훈련 단계에서 98.89%의 공격 성공률을 달성했으며, 트리거 패턴과 수량이 공격 성공의 핵심 요소임을 규명했고, 동시에 출시 단계 공격이 테스트된 모든 탐지 방법을 회피한다는 점을 드러냈다.

ABSTRACT

Masked image modeling (MIM) revolutionizes self-supervised learning (SSL) for image pre-training. In contrast to previous dominating self-supervised methods, i.e., contrastive learning, MIM attains state-of-the-art performance by masking and reconstructing random patches of the input image. However, the associated security and privacy risks of this novel generative method are unexplored. In this paper, we perform the first security risk quantification of MIM through the lens of backdoor attacks. Different from previous work, we are the first to systematically threat modeling on SSL in every phase of the model supply chain, i.e., pre-training, release, and downstream phases. Our evaluation shows that models built with MIM are vulnerable to existing backdoor attacks in release and downstream phases and are compromised by our proposed method in pre-training phase. For instance, on CIFAR10, the attack success rate can reach 99.62%, 96.48%, and 98.89% in the downstream phase, release phase, and pre-training phase, respectively. We also take the first step to investigate the success factors of backdoor attacks in the pre-training phase and find the trigger number and trigger pattern play key roles in the success of backdoor attacks while trigger location has only tiny effects. In the end, our empirical study of the defense mechanisms across three detection-level on model supply chain phases indicates that different defenses are suitable for backdoor attacks in different phases. However, backdoor attacks in the release phase cannot be detected by all three detection-level methods, calling for more effective defenses in future research.

연구 동기 및 목표

  • 마스킹 이미지 모델링(MIM), 최신 자기지도 학습 방법의 전체 공급망에서의 백도어 공격 위험을 체계적으로 분석하는 것.
  • MIM 모델이 사전 훈련, 출시, 후행 단계 전반에 걸쳐 백도어 공격에 얼마나 취약한지 평가하는 것.
  • 특히 MIM의 생성 메커니즘 맥락에서 사전 훈련 단계에서 백도어 성공에 영향을 주는 핵심 요인을 규명하는 것.
  • 모델 수준, 입력 수준, 데이터셋 수준의 기존 방어 기법이 MIM 공급망의 다양한 공격 단계에서 얼마나 효과적인지 평가하는 것.
  • 특히 출시 단계 백도어 공격(Type II)에 대해 모든 세 가지 탐지 수준을 회피하는 이유를 규명하고, 향후 방어 연구에 대한 시사점을 제시하는 것.

제안 방법

  • MIM 사전 훈련 동안 트리거 수를 증가시켜 공격 성공률을 향상시키는 새로운 백도어 공격 방법을 제안한다.
  • MIM의 마스크 및 예측 메커니즘을 활용하여, 다수의 트리거를 포함한 이미지로 데이터셋을 오염시켜 사전 훈련 단계에서 트리거를 삽입하는 전략을 적용한다.
  • 백색 트리거와 공개된 Hidden Trigger Backdoor Attack(HTBA) 트리거를 사용하여 트리거 패턴이 공격 성능에 미치는 영향을 평가한다.
  • 스펙트럼 서명을 사용하여 데이터셋 수준의 방어를 구현하고, 특성 표현 공분산을 분석하여 사전 훈련 세트의 오염된 샘플을 탐지한다.
  • 모델 수준 탐지에선 레이블별 수정 비용을, 입력 수준 탐지에선 변형된 입력의 엔트로피 분포 분석을 통해 탐지 기법을 적용한다.
  • 트리거 성질(패턴, 수량, 위치, 크기, 오염 비율)에 대한 분석 실험을 수행하여 사전 훈련 단계 공격의 핵심 성공 요인을 규명한다.

실험 결과

연구 질문

  • RQ1MIM 모델은 사전 훈련, 출시, 후행 단계를 포함한 전체 모델 공급망에서 백도어 공격에 얼마나 취약한가?
  • RQ2사전 훈련 단계에서 MIM의 백도어 성공에 영향을 주는 주요 트리거 성질(패턴, 수량, 위치, 크기, 오염 비율)은 무엇인가?
  • RQ3기존의 방어 기법(모델 수준, 입력 수준, 데이터셋 수준)이 MIM 공급망의 모든 단계에서 백도어 공격을 효과적으로 탐지할 수 있는가?
  • RQ4왜 출시 단계 백도어 공격(Type II)은 세 가지 방어 수준 모두를 회피하는가? 이는 향후 방어 연구에 어떤 의미를 갖는가?
  • RQ5대조 학습을 위해 설계된 기존 백도어 공격의 성능은 MIM으로 어떻게 이행되는가? 효과적인 MIM 활용을 위해 어떤 수정이 필요한가?

주요 결과

  • 제안된 백도어 공격은 사전 훈련 단계에서 CIFAR10에서 98.89%의 공격 성공률, STL10에서 97.74%의 성공률를 기록하여 이전 방법보다 뚜렷이 뛰어나다.
  • 트리거 패턴과 수량이 공격 성공에 가장 큰 영향을 미치며, 트리거 위치는 MIM 사전 훈련에서 성능에 거의 영향을 주지 않는다.
  • 대조 학습을 위해 설계된 기존 백도어 공격는 MIM에선 성능이 열악하며, CIFAR10과 STL10에서 각각 베이스라인 대비 공격 성공률이 2.83%와 13.78% 뿐 높을 뿐이다.
  • 스펙트럼 서명을 활용한 데이터셋 수준의 방어는 사전 훈련 단계(Type I)에서 오염된 샘플을 효과적으로 탐지하지만, 낮은 오염 비율(예: 1%)에서는 백도어 점수가 청소된 점수 이하로 떨어져 실패한다.
  • 모델 수준 및 입력 수준의 방어 기법은 후행 단계의 백도어 공격을 성공적으로 탐지하지만, 세 가지 탐지 수준 모두에서 출시 단계 공격(Type II)을 탐지하지 못한다.
  • 세 가지 탐지 방법이 모두 출시 단계 백도어 공격을 식별하지 못한다는 점은, 향후 새로운 방어 기법이 필요로 하는 심각한 보안 격차를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.