Skip to main content
QUICK REVIEW

[논문 리뷰] Subnet Replacement: Deployment-stage backdoor attack against deep neural networks in gray-box setting

Xiangyu Qi, Zhu Jifeng|arXiv (Cornell University)|2021. 07. 15.
Adversarial Robustness in Machine Learning참고 문헌 21인용 수 9
한 줄 요약

이 논문은 사전 학습된 DNN의 일부를 악성 백도어 서브넷으로 교체함으로써, 파rameter 접근 없이 아키텍처 지식만으로도 청소년 정확도 감소가 1% 미만인 상태에서 95% 이상의 공격 성공률을 달성하는 그레이박스 배포 단계 백도어 공격인 Subnet Replacement Attack(SRA)을 제안한다. 이 공격은 실험실 환경에서 실시간 메모리 수정을 통해 실질적으로 구현되었다.

ABSTRACT

We study the realistic potential of conducting backdoor attack against deep neural networks (DNNs) during deployment stage. Specifically, our goal is to design a deployment-stage backdoor attack algorithm that is both threatening and realistically implementable. To this end, we propose Subnet Replacement Attack (SRA), which is capable of embedding backdoor into DNNs by directly modifying a limited number of model parameters. Considering the realistic practicability, we abandon the strong white-box assumption widely adopted in existing studies, instead, our algorithm works in a gray-box setting, where architecture information of the victim model is available but the adversaries do not have any knowledge of parameter values. The key philosophy underlying our approach is -- given any neural network instance (regardless of its specific parameter values) of a certain architecture, we can always embed a backdoor into that model instance, by replacing a very narrow subnet of a benign model (without backdoor) with a malicious backdoor subnet, which is designed to be sensitive (fire large activation value) to a particular backdoor trigger pattern.

연구 동기 및 목표

  • 깊이 신경망의 배포 단계에서 실제 제약 조건이 있는 환경에서 백도어 공격의 실현 가능성과 위협성을 조사한다.
  • 모델 아키텍처는 알 수 있지만 파라미터 값은 알 수 없는 그레이박스 환경에서 작동하는 백도어 공격을 설계한다.
  • 청결한 정확도에 미치는 영향을 최소화하면서도, 모델 파라미터의 소수의 부분만을 교체함으로써 효과적인 백도어 주입을 가능하게 하는 방법을 개발한다.
  • 실제 실험실 환경에서의 실시간 메모리 내 파라미터 수정을 통해 실제 적용 가능성을 입증한다.

제안 방법

  • 특정 백도어 트리거가 존재할 경우에만 활성화되는, 채널 수가 최소한인 트리거에 민감한 좁은 서브넷을 생성한다.
  • 기존 모델의 아키텍처를 유지하면서, 목표 DNN 아키텍처 내 정해진 작은 서브넷을 사전에 학습시킨 악성 서브넷으로 교체한다.
  • 이 방법은 그레이박스 가정에 기반한다: 모델 아키텍처는 알려져 있지만, 파라미터 값은 알려져 있지 않다. 이는 더 넓은 실제 적용 가능성을 제공한다.
  • 실제 시스템에서의 실시간 메모리 수정을 위해 두 가지 기술을 구현했다: (1) 모델 로딩 중 라이브러리 훅킹 및 (2) 배포 후 원격 스레드 삽입.
  • 백도어 서브넷은 트리거가 활성화되었을 때에만 높은 활성도를 보이도록 설계되어, 도청 가능성과 높은 공격 성공률을 확보한다.
  • 소프트웨어 시뮬레이션과 물리 세계 트리거 테스트를 포함한 표준 데이터셋을 사용하여 VGG16 및 VGGFace 모델에서 평가한다.

실험 결과

연구 질문

  • RQ1모델 파라미터에 접근할 수 없이도 DNN에 백도어를 효과적으로 주입할 수 있는가?
  • RQ2아키텍처 지식만으로도 청결 정확도에 미치는 영향을 최소화하면서 높은 공격 성공률을 달성할 수 있는가?
  • RQ3제안된 공격이 실제 시스템에서 실시간 메모리 내 파라미터 수정을 통해 실질적으로 실현 가능한가?
  • RQ4백도어 트리거가 물리 세계 환경에서 적용되었을 때 공격의 효과는 어떠한가?

주요 결과

  • CIFAR-10 이미지 분류 작업에서, SRA는 10개의 무작위 초기화된 VGG16 모델을 대상으로 평균 96.01%의 공격 성공률을 기록했으며, 청결 정확도는 평균 0.31% 감소하였다.
  • VGGFace 얼굴 인식 작업에서는 공격이 높은 효과를 유지했으며, 트리거가 물리적으로 인쇄된 상태에서 테스트 이미지에 적용되어도 백도어가 성공적으로 활성화되었다.
  • 실습 서버 환경에서 라이브러리 훅킹 및 원격 스레드 삽입 기술을 모두 활용하여 실시간 메모리 내 파라미터 수정이 성공적으로 구현되었다.
  • VGG16에서 백도어 서브넷은 원본 모델 용량의 0.05% 미만을 차지하여 최소한의 구조적 수정임을 확인했다.
  • 테스트 세트의 비대상 클래스 샘플에 트리거가 적용되었을 때도 공격 성공률가 95% 이상을 유지하였다.
  • 다양한 랜덤 시드로 학습된 서로 다른 모델 인스턴스에 대해서도 공격가 강건하게 작동하여, 동일 아키텍처의 모든 모델에 일반적으로 적용 가능함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.