Skip to main content
QUICK REVIEW

[논문 리뷰] Noise-response Analysis for Rapid Detection of Backdoors in Deep Neural Networks.

N. Benjamin Erichson, Dane Taylor|arXiv (Cornell University)|2020. 07. 31.
Adversarial Robustness in Machine Learning인용 수 9
한 줄 요약

이 논문은 입력 노이즈에 대한 민감도를 측정하여 딥 네ural 네트워크의 백도어를 신속하게 탐지하는 노이즈 반응 분석 방법을 제안한다. 이 방법은 고유한 지문이 되는 티트레이션 곡선을 생성하며, 기존 방법에 비해 수십 배에서 수백 배 빠른 속도로 백도어를 탐지한다. 이는 자동화된 티트레이션 스코어를 제공하여 신뢰할 수 있고 확장 가능한 탐지가 가능하다.

ABSTRACT

The pervasiveness of deep neural networks (DNNs) in technology, matched with the ubiquity of cloud-based training and transfer learning, is giving rise to a new frontier for cybersecurity whereby `structural malware' is manifest as compromised weights and activation pathways for unsecure DNNs. In particular, DNNs can be designed to have backdoors in which an adversary can easily and reliably fool a classifier by adding to any image a pattern of pixels called a trigger. Since DNNs are black-box algorithms, it is generally difficult to detect a backdoor or any other type of structural malware. To efficiently provide a reliable signal for the absence/presence of backdoors, we propose a rapid feature-generation step in which we study how DNNs respond to noise-infused images with varying noise intensity. This results in titration curves, which are a type of `fingerprinting' for DNNs. We find that DNNs with backdoors are more sensitive to input noise and respond in a characteristic way that reveals the backdoor and where it leads (i.e,. its target). Our empirical results demonstrate that we can accurately detect a backdoor with high confidence orders-of-magnitude faster than existing approaches (i.e., seconds versus hours). Our method also yields a titration-score that can automate the detection of compromised DNNs, whereas existing backdoor-detection strategies are not automated.

연구 동기 및 목표

  • 딥 네럴 네트워크에서 손상된 가중치나 학습 과정을 통해 유입되는 구조적 악성코드의 증가하는 위협에 대응하기 위해.
  • 기존의 백도어 탐지 방법의 한계를 극복하기 위해, 이는 느린 속도, 수동적 분석, 침입성 또는 블랙박스 분석에 의존하기 때문이다.
  • 모델 내부 분석이나 학습 데이터 접근 없이도 빠르고 확장 가능하며 자동화된 DNN 내 백도어 탐지 방법을 개발하기 위해.
  • 노이즈 민감도에서 유도된 신뢰할 수 있는 특징 기반 신호를 확립하여, 백도어가 있는 모델와 정상 모델을 구분하기 위해.

제안 방법

  • 다양한 강도의 제어된 노이즈를 입력 이미지에 주입하여 모델의 반응 동역학을 탐사한다.
  • 노이즈 수준이 증가함에 따라 모델의 출력 신뢰도 또는 활성화 패턴을 맵핑하는 티트레이션 곡선을 생성한다.
  • 이러한 티트레이션 곡선의 형태와 민감도를 백도어 존재 및 타겟 클래스 식별을 위한 지문으로 사용한다.
  • 티트레이션 스코어 특징을 기반으로 단순 분류기를 훈련시켜 다양한 모델에서 백도어 탐지를 자동화한다.
  • 백도어가 있는 모델는 특히 트리거 패턴 주변에서 노이즈에 대해 높은 민감도를 보임을 활용한다.
  • 학습 후 경량 분석 단계로 적용하여, 학습 데이터나 모델 아키텍처 정보에 접근할 필요 없이 작동한다.

실험 결과

연구 질문

  • RQ1노이즈 반응 분석은 백도어가 있는 딥 네럴 네트워크를 정상 모델과 신뢰성 있게 구분할 수 있는가?
  • RQ2DNN의 입력 노이즈에 대한 민감도는 백도어 존재와 어떤 관련이 있는가?
  • RQ3티트레이션 곡선은 백도어 트리거와 그 타겟을 식별하는 고유한 지문으로 기능할 수 있는가?
  • RQ4기존 수동 또는 히ュ리스틱 기반 접근 방식에 비해 이 방법은 얼마나 자동화된 백도어 탐지가 가능한가?
  • RQ5이 기법의 탐지 속도는 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • 백도어가 있는 모델는 특히 트리거 패턴 주변에서 정상 모델에 비해 노이즈에 대해 훨씬 높은 민감도를 보인다.
  • 노이즈 반응 분석에서 유도된 티트레이션 곡선은 높은 신뢰도로 백도어가 있는 모델와 정상 모델을 신속하게 구분한다.
  • 이 방법은 기존 접근 방식(예: 수시간 대비 수초)에 비해 수십 배에서 수백 배 빠른 속도로 백도어를 탐지한다.
  • 제안된 티트레이션 스코어는 완전한 자동화된 탐지를 가능하게 하여 이전 방법의 수동적이고 확장성 없는 성격을 극복한다.
  • 이 방법은 다양한 DNN 아키텍처와 데이터셋에서 뛰어난 일반화 능력을 보이며, 모델 내부 분석이 필요 없이도 안정적인 성능을 발휘한다.
  • 티트레이션 곡선의 형태와 피크 반응을 분석함으로써 백도어의 타겟 클래스를 성공적으로 식별할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.