Skip to main content
QUICK REVIEW

[논문 리뷰] Stateful Detection of Black-Box Adversarial Attacks

Steven Chen, Nicholas Carlini|arXiv (Cornell University)|2019. 07. 12.
Adversarial Robustness in Machine Learning참고 문헌 35인용 수 5
한 줄 요약

이 논문은 분류기의 쿼리 시퀀스를 분석하여 블랙박스 적대적 공격 생성을 탐지하는 상태 기반 방어 기법을 제안한다. 유사도 탐지 신경망을 사용해 적대적 쿼리 체인의 특징적인 패턴을 식별하며, 이는 적응형 쿼리 블라인딩 공격에도 효과를 유지하여 기존의 무상태 기반 방법을 뛰어넘는 새로운 강력한 블랙박스 적대적 예측 탐지 접근법을 제공한다.

ABSTRACT

The problem of adversarial examples, evasion attacks on machine learning classifiers, has proven extremely difficult to solve. This is true even when, as is the case in many practical settings, the classifier is hosted as a remote service and so the adversary does not have direct access to the model parameters. This paper argues that in such settings, defenders have a much larger space of actions than have been previously explored. Specifically, we deviate from the implicit assumption made by prior work that a defense must be a stateless function that operates on individual examples, and explore the possibility for stateful defenses. To begin, we develop a defense designed to detect the process of adversarial example generation. By keeping a history of the past queries, a defender can try to identify when a sequence of queries appears to be for the purpose of generating an adversarial example. We then introduce query blinding, a new class of attacks designed to bypass defenses that rely on such a defense approach. We believe that expanding the study of adversarial examples from stateless classifiers to stateful systems is not only more realistic for many black-box settings, but also gives the defender a much-needed advantage in responding to the adversary.

연구 동기 및 목표

  • 모델 출력만 접근 가능한 블랙박스 환경에서 적대적 예측 생성을 탐지하는 문제에 대응하기 위해.
  • 기존의 무상태 기반 접근 방식과는 달리, 쿼리 이력 정보를 활용해 적대적 학습 패턴을 탐지하는 상태 기반 방어 기법을 탐색하기 위해.
  • 적대적 공격자가 탐지 회피를 위해 쿼리 행동을 수정하는 적응형 공격에 대한 이러한 방어 기법의 내성에 대해 평가하기 위해.
  • 상태 기반 탐지 시스템을 위한 일반 목적의 회피 기법인 쿼리 블라인딩을 제안하고 검증하기 위해.
  • 상태 기반 탐지 기법이 블랙박스 적대적 공격에 대응할 때 실질적인 이점을 제공함을 보여주기 위해.

제안 방법

  • 방어 기법은 블랙박스 적대적 공격 생성의 특징인 매우 유사한 쿼리 시퀀스를 식별하도록 훈련된 유사도 탐지 신경망을 사용한다.
  • 시스템은 과거 쿼리 이력을 유지하고 실시간으로 유사도 탐지기를 적용해 적대적 쿼리 패턴을 탐지한다.
  • 기존 방어 기법과의 조합이 가능하도록 설계되어, 블랙박스 분류기의 다층적 방어를 가능하게 한다.
  • 새로운 공격 유형인 쿼리 블라인딩을 도입한다: 공격자는 블라인딩 함수를 사용해 입력을 사전 처리하여 적대적 의도를 숨기지만 분류기 출력의 유용성은 유지한다.
  • 블라인딩 함수는 사전 처리된 입력이 정상 데이터와 유사하게 보이게 하여 유사도 기반 탐지에 회피되며, 동시에 모델 출력을 재구성할 수 있도록 보장한다.
  • 방어 기법은 하드 레이블 블랙박스 환경에서 평가되었으며, 유저가 반환하는 클래스 레이블만 제공되는 조건에서 적응형 공격에도 효과를 유지함을 입증했다.

실험 결과

연구 질문

  • RQ1블랙박스 적대적 공격에 사용되는 쿼리 시퀀스는 상태 기반 분석을 통해 정상 쿼리 시퀀스와 구분할 수 있는가?
  • RQ2쿼리 유사도 탐지 기반의 상태 기반 방어 기법은 얼마나 효과적으로 적대적 예측 생성을 식별하는가?
  • RQ3적대적 공격자가 쿼리 블라인딩과 같은 일반 목적의 기법을 사용해 이러한 상태 기반 방어를 회피할 수 있는가?
  • RQ4제안된 방어 기법은 엔semble 적대적 훈련과 같은 다른 방어 기법과 조합되어도 유지되는가?
  • RQ5소프트 레이블 환경이나 모델 추출 공격 상황에서 상태 기반 탐지의 한계는 무엇인가?

주요 결과

  • 제안된 상태 기반 방어 기법은 자가 유사 쿼리 시퀀스를 식별하여 기존 최고 수준의 블랙박스 적대적 공격을 성공적으로 탐지하며, 높은 탐지 정확도를 달성한다.
  • 유사도 기반 탐지에 회피하기 위해 입력을 정상적으로 보이게 변형하는 쿼리 블라인딩 공격에도 여전히 효과를 유지한다.
  • 공격자가 전략을 적응적으로 수정하더라도 방어 기법은 내성적으로 강건함을 입증하며, 적응형 공격 회피 기법에 저항력이 있다.
  • 엔셈블 적대적 훈련과 같은 다른 방어 기법과 조합 가능하여, 블랙박스 공격에 대해 통합적이고 더 강력한 방어 체계를 형성할 수 있다.
  • 공격자가 모델 가중치를 추출할 수 있다면 이 방어 기법은 효과가 없음을 시사하며, 모델 추출 공격에 대비한 추가 상태 기반 방어가 필요함을 강조한다.
  • 이 방법은 일반화 가능하며, 적절한 유사도 인코더가 제공된다면 다른 도메인으로도 확장 가능하지만, 현재 평가는 이미지 분류에 국한되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.