Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Reprogramming of Neural Networks

Gamaleldin F. Elsayed, Ian Goodfellow|arXiv (Cornell University)|2018. 06. 28.
Adversarial Robustness in Machine Learning참고 문헌 33인용 수 21
한 줄 요약

이 논문은 사전 훈련된 딥 네ural 네트워크를 한 번의 고정된 적대적 편향을 적용하여 새로운 작업—예를 들어 MNIST 또는 CIFAR-10 이미지 분류—으로 재프로그래밍하는 새로운 공격인 적대적 재프로그래밍을 소개한다. 이 방법은 모델의 본질적 유연성을 활용하여 작업에 특화된 미세조정이나 입력별 계산 없이도 성공적인 작업 재사용을 달성한다.

ABSTRACT

Deep neural networks are susceptible to \emph{adversarial} attacks. In computer vision, well-crafted perturbations to images can cause neural networks to make mistakes such as confusing a cat with a computer. Previous adversarial attacks have been designed to degrade performance of models or cause machine learning models to produce specific outputs chosen ahead of time by the attacker. We introduce attacks that instead {\em reprogram} the target model to perform a task chosen by the attacker---without the attacker needing to specify or compute the desired output for each test-time input. This attack finds a single adversarial perturbation, that can be added to all test-time inputs to a machine learning model in order to cause the model to perform a task chosen by the adversary---even if the model was not trained to do this task. These perturbations can thus be considered a program for the new task. We demonstrate adversarial reprogramming on six ImageNet classification models, repurposing these models to perform a counting task, as well as classification tasks: classification of MNIST and CIFAR-10 examples presented as inputs to the ImageNet model.

연구 동기 및 목표

  • 사전 훈련된 신경망이 재훈련이나 입력별 수정 없이 완전히 새로운 작업을 수행할 수 있는지 조사하기 위해.
  • 다양한 입력 도메인에서 모델의 행동을 재프로그래밍하기 위해 단일 고정된 적대적 편향을 사용할 수 있는지의 가능성을 탐색하기 위해.
  • 특히 실세계 배포 환경에서 딥 네럴 네트워크가 이러한 재프로그래밍 공격에 얼마나 취약한지 평가하기 위해.
  • 적대적 프로그램을 보통의 입력에 숨겨 감지를 피할 수 있는지 평가하기 위해.
  • 배포된 머신러닝 시스템에서 적대적 재프로그래밍의 보안, 윤리적 사용, 계산 자원 오용 가능성에 대한 영향을 검토하기 위해.

제안 방법

  • 새로운 작업 도메인(예: MNIST)의 입력을 사전 훈련된 모델(예: ImageNet 분류기)의 입력 공간으로 매핑하는 학습 가능한 변환 $ h_f(\tilde{x}; \theta) $을 적대적 프로그램으로 정의한다.
  • 편향을 제어하기 위해 학습 가능한 파라미터 $ \theta $를 사용하며, $ \theta $는 모델의 출력이 목표 함수 $ g(\tilde{x}) $와 일치하도록 최적화된다.
  • 재프로그래밍된 모델의 새로운 작업에서의 분류 오차를 최소화하는 미분 가능한 목적함수를 사용하여 적대적 프로그램을 훈련하며, 편향 크기를 $ \alpha $를 통해 제약한다.
  • 입력 이미지를 무작위로 재배열하는 기법을 적용하여 적대적 신호를 은폐함으로써 침투성 향상 및 탐지 어려움 증가.
  • 원본 모델의 출력을 목표 작업의 출력 공간으로 변환하기 위해 하드코딩된 레이블 매핑 $ h_g $를 사용한다.
  • 표준 백프로파게이션을 사용하여 적대적 프로그램을 최적화하며, $ \theta $를 입력 변환을 정의하는 학습 가능한 파라미터로 간주한다.

실험 결과

연구 질문

  • RQ1사용자 정의된 고정된 입력 편향 하나만으로 사전 훈련된 신경망을 새로운 작업을 수행하도록 재프로그래밍할 수 있는가?
  • RQ2구조적 유사성이 없는 도메인 간(예: ImageNet 분류기에서 MNIST) 적대적 재프로그래밍이 얼마나 성공적으로 작동하는가?
  • RQ3적대적 프로그램은 보통의 입력에 숨겨져 감지를 피할 수 있는가?
  • RQ4모델 아키텍처와 훈련 방식이 적대적 재프로그래밍에 대한 취약성에 어떤 영향을 미치는가?
  • RQ5배포된 머신러닝 시스템에서 적대적 재프로그래밍의 보다 넓은 보안 및 윤리적 영향은 무엇인가?

주요 결과

  • 적대적 재프로그래밍은 단일 고정된 편향을 사용하여 여섯 개인 ImageNet 분류 모델을 수량 세기 작업, MNIST 분류, CIFAR-10 분류로 성공적으로 재프로그래밍했다.
  • 새로운 작업의 입력 데이터(예: MNIST)가 ImageNet 데이터와 시각적으로 유사성이 없더라도 공격가능성이 유지되어 모델의 높은 유연성을 입증했다.
  • 훈련된 모델은 무작위 초기화된 네트워크보다 재프로그래밍에 더 효과적이며, 학습된 표현이 취약성 증가에 기여함을 시사한다.
  • 적대적 프로그램은 보통의 보기에 보이는 ImageNet 이미지 안에 숨겨져 있어 공격가능성이 침투성 있고 탐지하기 어려운 수준이다.
  • 입력 변환 외에 입력별 계산이나 모델 미세조정이 필요 없이 재프로그래밍을 달성했으며, 이는 오직 입력 변환에 의존한다.
  • 데이터 분포가 겹치지 않는 경우에도 작동하므로, 적대적 재프로그래밍은 전이 학습만으로는 설명되지 않음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.