Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Lightweight Black-Box Attacks against Deep Neural Networks

Chenghao Sun, Yonggang Zhang|arXiv (Cornell University)|2022. 09. 29.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 최소한의 데이터로 훈련된 DNN의 얕은 층을 활용하여 클래스당 하나의 이미지만을 사용하여 공격 성공률가 높은 경량 블랙박스 공격을 제안한다. Error TransFormer(ETF)를 도입하여 매개변수 공간의 근사 오차를 특징 공간의 변형으로 변환함으로써, 전체 데이터 기반 블랙박스 공격의 공격 성공률의 97%를 달성한다.

ABSTRACT

Black-box attacks can generate adversarial examples without accessing the parameters of target model, largely exacerbating the threats of deployed deep neural networks (DNNs). However, previous works state that black-box attacks fail to mislead target models when their training data and outputs are inaccessible. In this work, we argue that black-box attacks can pose practical attacks in this extremely restrictive scenario where only several test samples are available. Specifically, we find that attacking the shallow layers of DNNs trained on a few test samples can generate powerful adversarial examples. As only a few samples are required, we refer to these attacks as lightweight black-box attacks. The main challenge to promoting lightweight attacks is to mitigate the adverse impact caused by the approximation error of shallow layers. As it is hard to mitigate the approximation error with few available samples, we propose Error TransFormer (ETF) for lightweight attacks. Namely, ETF transforms the approximation error in the parameter space into a perturbation in the feature space and alleviates the error by disturbing features. In experiments, lightweight black-box attacks with the proposed ETF achieve surprising results. For example, even if only 1 sample per category available, the attack success rate in lightweight black-box attacks is only about 3% lower than that of the black-box attacks with complete training data.

연구 동기 및 목표

  • 훈련 데이터나 모델 출력이 제공되지 않는 '노박스 설정'에서 블랙박스 공격이 가능한지 조사한다.
  • 특히 DNN의 얕은 층에서 최소한의 데이터로 훈련된 서rogate 모델에서 발생하는 높은 근사 오차 문제를 해결한다.
  • 매개변수 공간의 오차를 특징 공간의 변형으로 변환하여, 제한된 데이터로 인한 공격 효과 저하를 완화하는 방법을 개발한다.
  • 실세계 상황에서 경량 블랙박스 공격이 전체 데이터 기반 블랙박스 공격과 거의 동일한 성능을 달성할 수 있음을 보여준다.

제안 방법

  • 최소한의 샘플로 훈련되어도 안정적이고 일반화 능력이 뛰어난 DNN의 얕은 층을 활용하여 경량 서rogate 모델을 구축한다.
  • 매개변수 공간의 근사 오차를 최악의 특징 공간 변형으로 매핑하는 min-max 프레임워크인 Error TransFormer(ETF)를 제안한다.
  • 최악의 특징 공간 변형에 대해 최대의 속임수를 유도하는 방식으로 적대적 예제를 생성하기 위해 특징 공간 최적화 기법을 사용한다.
  • 지도 학습이 불가능한 상황에서, 대체로 레이블이 없는 또는 분포 외 데이터를 사용하여 대비 학습과 자기지도 사전 훈련을 활용해 서rogate 모델을 훈련한다.
  • ETF 프레임워크를 지도 및 비지도 설정, 특히 OOD 데이터에 적용하여 공격 성공률 유지를 도모한다.
  • 모델 근사 오차로 유도되는 최악의 특징 공간 변형에 대비하여, 적대적 예제를 생성하기 위해 min-max 공식을 활용한다.

실험 결과

연구 질문

  • RQ1훈련 데이터나 모델 출력이 제공되지 않는 상황에서, 테스트 샘플이 몇 개 뿐인 '노박스 설정'에서 블랙박스 공격이 효과적으로 작동할 수 있는가?
  • RQ2최소한의 훈련 데이터로 인해 성능이 제한되는 상황에서도 DNN의 얕은 층이 왜 경량 블랙박스 공격에 적합한가?
  • RQ3최소한의 데이터로 훈련된 서rogate 모델에서 발생하는 근사 오차를 효과적으로 완화하는 방법은 무엇인가?
  • RQ4제안된 ETF 방법은 지도 학습이 불가능한 비지도 또는 OOD(분포 외) 데이터 설정에서도 높은 공격 성능을 유지할 수 있는가?
  • RQ5클래스당 하나의 이미지만을 사용할 경우, 경량 블랙박스 공격이 전체 데이터 기반 블랙박스 공격과 얼마나 유사한 성능을 낼 수 있는가?

주요 결과

  • 클래스당 하나의 이미지만을 사용할 경우, 경량 블랙박스 공격의 공격 성공률는 전체 데이터 기반 블랙박스 공격과 3% 밖에 떨어지지 않는다.
  • 제안된 Error TransFormer(ETF) 방법은 최소한의 데이터로 훈련된 서rogate 모델의 근사 오차를 특징 공간의 변형으로 변환함으로써 효과적으로 완화한다.
  • ETF는 지도 학습 여부에 관계없이 높은 성능을 유지하며, 지도 학습이 없는 경우와 동일한 공격 성공률를 달성한다.
  • 분포 이탈 데이터(예: STL-10)로 사전 훈련된 모델을 사용할 경우에도 성능이 유지되어 분포 이탈에 대한 강건성을 입증한다.
  • 7개의 ImageNet 모델에 대한 실험을 통해, ETF를 적용한 경량 공격이 노박스 설정에서 기존의 블랙박스 공격 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 최소한의 데이터 조건에서도 VGG19, ResNet-152, DenseNet, MobileNet 등 다양한 아키텍처에서 공격 성공률가 높게 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.