Skip to main content
QUICK REVIEW

[논문 리뷰] TBT: Targeted Neural Network Attack with Bit Trojan

Adnan Siraj Rakin, Zhezhi He|arXiv (Cornell University)|2019. 09. 10.
Adversarial Robustness in Machine Learning참고 문헌 34인용 수 12
한 줄 요약

이 논문은 DRAM에 저장된 DNN 가중치의 몇몇 취약 비트를 row-hammer 기법을 사용해 뒤집음으로써 타겟된 백도어를 삽입하는 새로운 신경망 공격인 Targeted Bit Trojan(TBT)을 제안한다. 이 공격는 ResNet-18에서 CIFAR-10에 대해 단 84개의 비트 뒤집기로 92%의 타겟된 오분류를 달성하면서도 정상 입력에 대한 정상적인 정확도를 유지한다.

ABSTRACT

Security of modern Deep Neural Networks (DNNs) is under severe scrutiny as the deployment of these models become widespread in many intelligence-based applications. Most recently, DNNs are attacked through Trojan which can effectively infect the model during the training phase and get activated only through specific input patterns (i.e, trigger) during inference. In this work, for the first time, we propose a novel Targeted Bit Trojan(TBT) method, which can insert a targeted neural Trojan into a DNN through the bit-flip attack. Our algorithm efficiently generates a trigger specifically designed to locate certain vulnerable bits of DNN weights stored in main memory (i.e., DRAM). The objective is that once the attacker flips these vulnerable bits, the network still operates with normal inference accuracy with benign input. However, when the attacker activates the trigger by embedding it with any input, the network is forced to classify all inputs to a certain target class. We demonstrate that flipping only several vulnerable bits identified by our method, using available bit-flip techniques (i.e, row-hammer), can transform a fully functional DNN model into a Trojan-infected model. We perform extensive experiments of CIFAR-10, SVHN and ImageNet datasets on both VGG-16 and Resnet-18 architectures. Our proposed TBT could classify 92 % of test images to a target class with as little as 84 bit-flips out of 88 million weight bits on Resnet-18 for CIFAR10 dataset.

연구 동기 및 목표

  • 주로 메인 메모리에서 비트 수준으로 작동하는 새로운 종류의 신경 트로이 목마 공격를 개발하여, 모델 재학습이나 데이터 오염이 필요 없도록 한다.
  • 정상 추론 성능에 영향을 주지 않으면서도 타겟된 오분류를 유도할 수 있는 DNN 가중치의 특정 취약 비트를 식별한다.
  • 기존의 row-hammer 스타일 기법을 사용해 소수의 비트 뒤집기로도 깨끗한 DNN를 백도어가 있는 모델로 신뢰성 있게 변환할 수 있음을 입증한다.
  • 여러 데이터셋(CIFAR-10, SVHN, ImageNet)과 아키텍처(VGG-16, ResNet-18)를 통해 공격의 효과성을 검증한다.

제안 방법

  • 타겟 클래스에 가장 민감한 뉴런을 식별하기 위해 신경 기울기 순위(NGR)를 제안하여 정확한 트리거 생성을 가능하게 한다.
  • NGR 출력을 기반으로 타겟 뉴런이 활성화될 때 강하게 작동하도록 트리거를 설계한다.
  • 트리거가 존재할 때에만 네트워크 동작 방식이 변화하는 특정 가중치 비트를 식별하기 위해 트로이 비트 검색(TBS)을 도입한다.
  • 추론 중 메인 메모리에 있는 식별된 취약 비트를 row-hammer 스타일의 비트 뒤집기 공격으로 수정한다.
  • 트리거가 없을 경우, 비트 뒤집기 후에도 깨끗한 모델과 거의 동일한 정확도를 유지함을 보장한다.
  • 두 단계 프로세스를 사용한다: 첫 번째로 NGR이 타겟 뉴런을 식별하고, 두 번째로 TBS가 트로이 행동을 유도할 수 있는 비트 위치를 특정한다.

실험 결과

연구 질문

  • RQ1주로 메인 메모리에 저장된 DNN 가중치의 몇몇 비트만 뒤집어도 타겟된 신경 트로이 목마를 유도할 수 있는가?
  • RQ2트리거가 존재할 경우 모든 입력이 타겟 클래스로 오분류되도록 하면서도 정상 입력에 대한 정상 추론 정확도를 유지할 수 있는가?
  • RQ3실제 세계의 DNN에서 높은 타겟 오분류를 달성하기 위해 필요한 최소한의 비트 뒤집기 수는 얼마인가?
  • RQ4기존의 사이드채널 비트 뒤집기 기법인 row-hammer가 타겟된 백도어를 삽입하는 데 효과적으로 재사용될 수 있는가?
  • RQ5TBT 방법은 다양한 데이터셋과 모델 아키텍처에서 얼마나 효과적인가?

주요 결과

  • TBT는 8800만 개의 가중치 비트 중 단 84개의 비트 뒤집기로 ResNet-18에서 CIFAR-10에서 타겟된 오분류를 성공적으로 유도한다.
  • 트리거가 존재할 경우 테스트 이미지의 92%가 타겟 클래스로 오분류되며, 깨끗한 입력에 대해서는 거의 동일한 정확도를 유지한다.
  • 이 방법은 여러 데이터셋(CIFAR-10, SVHN, ImageNet)과 아키텍처(VGG-16, ResNet-18)에서 효과적이며, 광범위한 적용 가능성을 보여준다.
  • 학습 데이터, 하이퍼파라미터, 모델 재학습에 대한 접근이 필요 없으며, 오직 추론 중 메인 메모리의 읽기/쓰기 접근만으로도 공격가능하다.
  • 특정 비트가 비트 뒤집기 공격에 취약한 것은 측정 가능하며 실제로도 활용 가능하며, TBS는 높은 정밀도로 핵심 가중치 위치를 식별한다.
  • 트리거가 없을 경우 모델이 정상적으로 작동하므로 표준 강건성 검사로는 탐지하기 어려우며, 공격는 침투성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.