Skip to main content
QUICK REVIEW

[논문 리뷰] Perturbing Across the Feature Hierarchy to Improve Standard and Strict Blackbox Attack Transferability

Nathan Inkawhich, Kevin J Liang|arXiv (Cornell University)|2020. 04. 29.
Adversarial Robustness in Machine Learning참고 문헌 37인용 수 30
한 줄 요약

이 논문은 상태-최대의 타깃 블랙박스 전이 가능성을 달성하기 위해 중간 표현을 DNN 전반에 걸쳐 교란하는 다층 특징 공간 적대적 공격 프레임워크(FDA 변형)를 제안하며, 교차 분포 시나리오와 쿼리 기반 확장을 포함한다.

ABSTRACT

We consider the blackbox transfer-based targeted adversarial attack threat model in the realm of deep neural network (DNN) image classifiers. Rather than focusing on crossing decision boundaries at the output layer of the source model, our method perturbs representations throughout the extracted feature hierarchy to resemble other classes. We design a flexible attack framework that allows for multi-layer perturbations and demonstrates state-of-the-art targeted transfer performance between ImageNet DNNs. We also show the superiority of our feature space methods under a relaxation of the common assumption that the source and target models are trained on the same dataset and label space, in some instances achieving a $10 imes$ increase in targeted success rate relative to other blackbox transfer methods. Finally, we analyze why the proposed methods outperform existing attack strategies and show an extension of the method in the case when limited queries to the blackbox model are allowed.

연구 동기 및 목표

  • DNN 이미지 분류기에 대한 더 강력한 타깃된 블랙박스 전이 공격을 고안하고 개발한다.
  • 출력 계층의 교란을 넘어서 네트워크 깊이에 걸쳐 다층 특징 표현을 교란한다.
  • 보조 네트워크를 사용해 계층별 및 클래스별 특징 분포를 모델링하여 적대적 노이즈를 안내한다.
  • ImageNet 모델에서 최첨단 타깃 전이 성능을 입증하고 교차 분포 전이를 평가한다.
  • FDA 기반 선행정보를 그래디언트 추정 공격과 결합해 쿼리 효율적인 확장을 탐색한다.

제안 방법

  • 각 층 l과 클래스 y에 대해 p(y|f_l(x))를 추정하기 위해 보조 모델 g_{l,y}를 정의하고 학습한다.
  • FDA 목표를 다층 교란으로 확장하고, 선택적으로 흰상자 출력이 목표 클래스와 일치하도록 교차 엔트로피 항를 포함한다.
  • 선택된 계층들 간의 per-layer 타깃 확률 합과 특징 교란 항을 최대화하여 L_p 제약하에 교란(delta)을 최적화한다(FDA(N)); 선택적으로 +xent 확장을 포함한다.
  • PyTorch 자동 미분을 사용해 공격을 구성하고 모멘텀을 사용한 반복적 투영 경사 하강법으로 적대적 예제를 생성한다.
  • ImageNet 모델에서 표준 블랙박스 전이 성능을 평가하고 제한된 데이터셋(RINet)으로 교차 분포 실험을 수행하며 P-RGF에서 FDA 기반 선행정보를 사용해 쿼리 기반 확장을 테스트한다.

실험 결과

연구 질문

  • RQ1여러 중간 계층에 걸친 섞임이 블랙박스 공격에서 타깃 전이 가능성에 어떤 영향을 미치는가?
  • RQ2다층 특징 공간 공격이 표준 및 엄격한 블랙박스 설정에서 단층 또는 출력층 공격보다 더 우수한가?
  • RQ3교차 분포 학습 데이터 및 레이블 공간의 차이가 특징 공간 공격에 의해 완화될 수 있는가?
  • RQ4교차 엔트로피 항의 추가와 다층 교란이 특징 공간에서의 전이 성공과 교란에 어떤 영향을 미치는가?
  • RQ5전이 선행정보를 활용한 제한된 쿼리 확장이 쿼리 효율적인 타깃 공격을 개선할 수 있는가?

주요 결과

  • 다층 FDA 공격은 출력층 기반의 기준선 및 단일층 FDA에 비해 타깃 전이 비율을 크게 향상시키며, tSuc에서 이득이 종종 10포인트 이상을 넘는다.
  • 교차 엔트로피 항(FDA +xent)을 포함하면 많은 설정에서 타깃 성공률이 크게 증가하고 다층 교란을 보완한다.
  • FDA(N)에서 층 수 N을 늘리면 많은 전이에서 타깃 성공률이 거의 두 배가 되며, 앙상블 기반 접근법을 능가한다.
  • 교차 분포 시나리오에서 FDA 기반 방법은 TMIM 및 TMIM+SGM보다 우수하며, 화이트박스와 블랙박스 데이터셋 또는 라벨 공간이 다를 때도 두드러진 이점을 보인다.
  • P-RGF에서 FDA(5) +xent를 선행정보로 사용하는 쿼리 기반 확장은 제한된 쿼리에서 타깃 성공에 상당한 이득을 가져와 충분한 쿼리 시 90%를 초과하는 tSuc를 달성한다.
  • 원거리 전이에서 FDA(N) +xent는 기준선보다 현저히 높은 전이 가능성을 보여주어 특징-계층 교란의 강점을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.