Skip to main content
QUICK REVIEW

[논문 리뷰] Blacklight: Scalable Defense for Neural Networks against Query-Based Black-Box Attacks

Huiying Li, Shawn Shan|arXiv (Cornell University)|2020. 06. 24.
Adversarial Robustness in Machine Learning인용 수 12
한 줄 요약

Blacklight는 확장 가능한 방어 기법으로, 확률적 콘텐츠 지문을 통해 반복 최적화 쿼리 간 유사성을 분석함으로써 쿼리 기반 블랙박스 공격을 탐지한다. 반복 최적화 쿼리 간 유사성을 활용함으로써, 지속적인 공격자 및 고도의 대응 전략에도 불구하고 거의 완벽한 탐지 성능(대부분의 공격에 100%)을 달성하며, 임계값 이하의 거짓 경고율을 유지한다.

ABSTRACT

Deep learning systems are known to be vulnerable to adversarial examples. In particular, query-based black-box attacks do not require knowledge of the deep learning model, but can compute adversarial examples over the network by submitting queries and inspecting returns. Recent work largely improves the efficiency of those attacks, demonstrating their practicality on today's ML-as-a-service platforms. We propose Blacklight, a new defense against query-based black-box adversarial attacks. The fundamental insight driving our design is that, to compute adversarial examples, these attacks perform iterative optimization over the network, producing image queries highly similar in the input space. Blacklight detects query-based black-box attacks by detecting highly similar queries, using an efficient similarity engine operating on probabilistic content fingerprints. We evaluate Blacklight against eight state-of-the-art attacks, across a variety of models and image classification tasks. Blacklight identifies them all, often after only a handful of queries. By rejecting all detected queries, Blacklight prevents any attack to complete, even when attackers persist to submit queries after account ban or query rejection. Blacklight is also robust against several powerful countermeasures, including an optimal black-box attack that approximates white-box attacks in efficiency. Finally, we illustrate how Blacklight generalizes to other domains like text classification.

연구 동기 및 목표

  • MLaaS 플랫폼에서 증가하는 쿼리 기반 블랙박스 공격의 위협을 해결하기 위해, 모델에 대한 액세스 없이 반복적 쿼리 최적화를 통해 악성 예제를 생성하는 공격을 방지한다.
  • 공격자가 계정을 변경하거나 고도로 효율적인 쿼리 전략을 사용하는 경우에도 효과를 유지할 수 있는 방어 기법을 설계한다.
  • 반복 최적화 과정에서 생성된 쿼리들이 매우 유사한 입력 공간에서 발생한다는 점을 활용하여, 악성 쿼리를 입력 유사성 기반으로 탐지한다.
  • 적응형 및 이상화된 공격 변종(근접 화이트박스 효율성 포함)에 대해 확장성과 강건성을 확보한다.
  • 이미지 분류 외의 분야, 예를 들어 텍스트 분류 분야로도 이 방어 기법을 일반화한다.

제안 방법

  • Blacklight는 각 입력 쿼리에 대해 보안성과 단방향 해시 함수를 사용하여 컴팩트한 확률적 콘텐츠 지문을 생성함으로써, 의미적으로 유사한 입력이 겹치는 지문을 생성한다.
  • 들어오는 쿼리의 지문을 이전 지문의 캐시된 집합과 비교하여 잠재적인 악성 쿼리를 탐지하며, 겹침 비율이 임계값을 초과하면 경고를 발생시킨다.
  • 이 방어 기법은 계정에 종속되지 않으며, 오직 입력 유사성에 의존하므로 공격자가 계정을 변경하더라도 효과를 유지한다.
  • 지문을 입력 변형으로 조작하려는 회피 공격을 방지하기 위해 소금이 첨가된 양자화와 가이드된 변환을 적용한다.
  • 지문 캐시를 주기적으로 리셋하여 장기적 추적을 방지하지만, 이 리셋 윈도우는 일시정지 및 재개 공격에 대한 높은 시간 비용으로 인해 효과적으로 완화된다.
  • 경량이고 확장 가능한 아키텍처로 설계되어 실시간으로 생산 환경의 ML 서비스에서 효율적으로 작동한다.

실험 결과

연구 질문

  • RQ1공격자가 여러 계정을 전환하더라도, 반복 최적화 과정에서 생성된 매우 유사한 쿼리를 탐지함으로써 쿼리 기반 블랙박스 공격을 방어할 수 있는가?
  • RQ2쿼리 수를 줄이는 데에 효율적인 고도의 공격에 대해 이 방어 기법은 얼마나 효과적인가?
  • RQ3완벽한 정확도로 화이트박스 기반 기울기 정보를 근사하는 이상화된 공격에 대해서도 이 방어 기법은 강건한가?
  • RQ4시스템의 리셋 메커니즘을 악용하는 회피 공격에 대해 이 방어 기법의 성능은 어떠한가?
  • RQ5이 방어 기법은 이미지 기반 모델 외의 작업, 예를 들어 텍트 분류 작업으로도 일반화 가능한가?

주요 결과

  • Blacklight는 그래디언트 추정 및 그래디언트 없는 최적화를 사용하는 8종의 최첨단 쿼리 기반 블랙박스 공격에 대해 100%의 탐지율을 기록한다.
  • 평균적으로 2개의 쿼리 이후에 공격을 탐지하며, 첫 몇 번의 쿼리에서 99%의 탐지 커버리지를 확보한다.
  • 최적의 블랙박스 공격 가정 조건(공격자가 기울기를 완벽하게 추정하는 경우)에서도, CW 기반 공격은 100%로 탐지되고, PGD 기반 공격은 81%로 탐지된다.
  • 쿼리 수를 줄이기 위해 대체 모델을 사용하는 하이브리드 공격 역시 탐지되며, 평균 2개의 쿼리 이후 100% 탐지율과 99% 커버리지를 확보한다.
  • 리셋 윈도우를 악용하는 일시정지 및 재개 공격는 평균 1,000일 이상(약 3년)이 소요되어 실용성이 떨어진다.
  • 이 방어 기법은 텍스트 분류 작업으로도 일반화되며, 이미지 기반 모델 외의 분야에 대한 광범위한 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.