Skip to main content
QUICK REVIEW

[논문 리뷰] PoTrojan: powerful neural-level trojan designs in deep learning models

Minhui Zou, Yang Shi|arXiv (Cornell University)|2018. 02. 08.
Adversarial Robustness in Machine Learning참고 문헌 11인용 수 49
한 줄 요약

이 논문은 PoTrojan을 소개합니다, 재훈련 없이 사전 학습된 신경망에 주입될 수 있는 뉴런 수준의 트로이목마로, rare inputs에 의해 작동하고 오작동이나 잘못 분류를 유발하며 AlexNet과 VGG16에서 시연됩니다.

ABSTRACT

With the popularity of deep learning (DL), artificial intelligence (AI) has been applied in many areas of human life. Neural network or artificial neural network (NN), the main technique behind DL, has been extensively studied to facilitate computer vision and natural language recognition. However, the more we rely on information technology, the more vulnerable we are. That is, malicious NNs could bring huge threat in the so-called coming AI era. In this paper, for the first time in the literature, we propose a novel approach to design and insert powerful neural-level trojans or PoTrojan in pre-trained NN models. Most of the time, PoTrojans remain inactive, not affecting the normal functions of their host NN models. PoTrojans could only be triggered in very rare conditions. Once activated, however, the PoTrojans could cause the host NN models to malfunction, either falsely predicting or classifying, which is a significant threat to human society of the AI era. We would explain the principles of PoTrojans and the easiness of designing and inserting them in pre-trained deep learning models. PoTrojans doesn't modify the existing architecture or parameters of the pre-trained models, without re-training. Hence, the proposed method is very efficient.

연구 동기 및 목표

  • 사전 학습된 신경망에서 뉴런 수준 트로이안(PoTrojan)의 개념을 도입한다.
  • 토이 예제를 보여주고 PoTrojan이 어떻게 설계되고 삽입될 수 있는지 retraining 없이 설명한다.
  • PoTrojan의 트리거와 페이로드를 설계하기 위한 일반 알고리즘을 제시한다.
  • 실제 모델(AlexNet 및 VGG16)에서 PoTro Trojan의 은밀성 및 유해성을 검증한다.

제안 방법

  • PoTrojan 구성요소를 정의한다: 트리거 시냅스와 페이로드 시냅스.
  • 단일 뉴런 및 다중 뉴런 PoTro Trojan 디자인을 시연하여 희귀 트리거 조건을 만든다.
  • 활성화 확률을 낮추기 위한 트리거 설계 방정식을 제공한다.
  • 활성화 후 출력을 방향잡기 위한 페이로드 설계를 설명한다. 트레이닝 인스턴스에 접근 여부와 상관없이.
  • 트리거 매개변수와 페이로드 매개변수를 계산하기 위한 알고리즘(그래디언트 기반 단계 포함)을 개 outlines다.
  • ImageNet에서 학습된 AlexNet과 VGG16에서 트리거링과 영향력을 평가하기 위한 실험적 검증.

실험 결과

연구 질문

  • RQ1사전 학습된 모델에 아키텍처를 수정하거나 재학습 없이 뉴런 수준의 트로이안이 삽입될 수 있는가?
  • RQ2극히 희귀한 조건에서 PoTrojan이 작동하도록 트리거를 어떻게 설계할 수 있는가?
  • RQ3트리거되었을 때 모델 출력을 의미 있게 바꾸도록 페이로드를 어떻게 구성해야 하는가?
  • RQ4실제 네트워크인 AlexNet과 VGG16에서 PoTro Trojan의 은밀성(우발적 트리거링 비율)과 유해한 영향은 어떤가?

주요 결과

  • PoTrojans는 기존 매개변수나 아키텍처를 변경하지 않고도 사전 학습된 모델에 삽입될 수 있어 효율적인 악용을 가능하게 한다.
  • 트리거 입력은 PoTrojans를 높은 신뢰도로 활성화할 수 있으며(실험 예에서 삽입된 경우 100% 트리거링을 보였다).
  • 실험에서 트리거 입력이 아닌 입력에 대한 우발적 트리거링은 무시할 만한 수준이다(테스트된 PoTrojans에서 우발적 트리거링 비율 0으로 보고).
  • 트리거된 PoTrojans는 상당한 잘못된 분류 또는 목표 출력 를 일으킬 수 있으며, 테스트 사례에서 특정 레이블을 높은 확률로 강제로 출력하도록 했다.
  • 페이로드 설계는 선택된 목표로 출력을 조정할 수 있게 한다(예: 특정 레이블로 오분류 시도).
  • AlexNet과 VGG16에 대한 실험은 트리거 조건하에서 트리거링 동작과 영향력 있는 출력을 모두 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.