Skip to main content
QUICK REVIEW

[논문 리뷰] DeepSearch: A Simple and Effective Blackbox Attack for Deep Neural Networks

Fuyuan Zhang, Sankalan Pal Chowdhury|arXiv (Cornell University)|2019. 10. 14.
Adversarial Robustness in Machine Learning참고 문헌 86인용 수 4
한 줄 요약

DeepSearch는 $L_{\infty}$ 왜곡이 낮은 미세한 적대적 예제를 생성하기 위해 피드백 지향 퍼지잉과 반복적 정밀 조정을 사용하는 쿼리 효율적이고 블랙박스인 딥 네럴 네트워크를 위한 적대적 공격이다. SVHN, CIFAR-10 및 ImageNet에서 최신 블랙박스 공격들보다 공격 성공률과 쿼리 효율성이 뛰어나며, 적대적 훈련으로 보호된 모델에 대해서도 성능을 유지한다.

ABSTRACT

Although deep neural networks have been very successful in image-classification tasks, they are prone to adversarial attacks. To generate adversarial inputs, there has emerged a wide variety of techniques, such as black- and whitebox attacks for neural networks. In this paper, we present DeepSearch, a novel fuzzing-based, query-efficient, blackbox attack for image classifiers. Despite its simplicity, DeepSearch is shown to be more effective in finding adversarial inputs than state-of-the-art blackbox approaches. DeepSearch is additionally able to generate the most subtle adversarial inputs in comparison to these approaches.

연구 동기 및 목표

  • 제한된 쿼리 예산 내에서 작동하는 쿼리 효율적인 블랙박스 공격을 개발하는 것.
  • 모델 예측 점수에서 유래한 피드백을 통해 퍼지잉을 이끌어 공격 성공률을 높이는 것.
  • 반복적 정밀 조정 과정을 통해 적대적 예제의 왜곡을 줄이는 것.
  • 블랙박스 환경에서 쿼리 수를 최소화하기 위해 계층적 그룹화를 적응시키는 것.
  • 표준 모델과 적대적 훈련으로 보호된 모델에 대한 효과를 평가하는 것.

제안 방법

  • DeepSearch는 정확하게 분류된 이미지에서 시작하여 피드백 지향 픽셀 변형을 적용하여 결정 경계에 효율적으로 접근한다.
  • 모델 출력 점수를 기반으로 잘못 분류를 유도할 가능성이 높은 변형을 우선순위에 따라 정렬하는 피드백 메커니즘을 사용한다.
  • 다중 이미지 차원을 동시에 퍼지잉하기 위해 계층적 그룹화를 활용하여 쿼리 수를 크게 줄인다.
  • 적대적 예제를 발견한 후에는 $L_{\infty}$ 왜곡을 최소화하면서도 잘못 분류 상태를 유지하기 위해 반복적 정밀 조정을 적용한다.
  • 이 방법은 $L_{\infty}$-제한된 변형에 제약을 두며, 예측 점수를 얻기 위해 모델을 쿼리하기만 한다.
  • 모델 아키텍처나 파라미터에 접근할 수 없는 블랙박스 환경을 대상으로 설계되어 있다.

실험 결과

연구 질문

  • RQ1간단한 퍼지잉 기반 접근 방식이 쿼리 효율성과 성공률 면에서 기존 최고 수준의 블랙박스 공격을 능가할 수 있는가?
  • RQ2피드백 지향 변형은 최소한의 쿼리로 적대적 예제를 향해 탐색하는 데 얼마나 효과적인가?
  • RQ3반복적 정밀 조정을 통해 얼마나 적은 왜곡의 적대적 예제를 생성할 수 있는가?
  • RQ4계층적 그룹화가 블랙박스 공격에서 필요한 쿼리 수를 크게 줄일 수 있는가?
  • RQ5DeepSearch는 적대적 훈련으로 강화된 모델에 대해 어떻게 성능을 보이는가?

주요 결과

  • DeepSearch는 SVHN, CIFAR-10 및 ImageNet에서 쿼리 제한 환경에서 평가된 모든 블랙박스 공격 중에서 가장 높은 공격 성공률를 기록한다.
  • 최신 기법들보다 훨씬 낮은 $L_{\infty}$ 왜곡을 가지며, 이는 더 높은 은폐성(stealthiness)을 의미한다.
  • 반복적 정밀 조정 단계는 잘못 분류 상태를 유지하면서도 적대적 변형의 크기를 줄여 더 사소한 공격을 생성한다.
  • 계층적 그룹화 덕분에 쿼리 수가 크게 감소하여, 기울기 추정 및 기타 쿼리 기반 방법보다 DeepSearch가 훨씬 효율적이다.
  • DeepSearch는 적대적 훈련으로 보호된 모델을 성공적으로 공격하여 일반적인 방어 기법에 대한 강건성을 입증한다.
  • 쿼리 예산이 심각하게 제한된 상황에서도 Ilyas 등(2018), Guo 등(2019), Moon 등(2019)의 방법들을 능가하는 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.