Skip to main content
QUICK REVIEW

[논문 리뷰] Preprocessors Matter! Realistic Decision-Based Attacks on Machine Learning Systems

Chawin Sitawarin, Florian Tramèr|arXiv (Cornell University)|2022. 10. 07.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 실제 머신러닝 파이프라인에서 흔히 사용되는 전처리기들이 표준 결정 기반 블랙박스 공격에 심각한 영향을 미치며, 이로 인해 편향 노름이 최대 7배까지 증가함을 보여준다. 이를 극복하기 위해 저자는 두 단계 공격을 제안한다: 먼저 수백 번의 쿼리로 전처리기를 추출하고, 그 다음 전처리기 인식 공격을 수행함으로써 공격의 전반적인 효능을 복원한다. 이는 독립형 모델에서의 성능과 동일한 성능을 달성한다.

ABSTRACT

Decision-based attacks construct adversarial examples against a machine learning (ML) model by making only hard-label queries. These attacks have mainly been applied directly to standalone neural networks. However, in practice, ML models are just one component of a larger learning system. We find that by adding a single preprocessor in front of a classifier, state-of-the-art query-based attacks are up to 7$ imes$ less effective at attacking a prediction pipeline than at attacking the model alone. We explain this discrepancy by the fact that most preprocessors introduce some notion of invariance to the input space. Hence, attacks that are unaware of this invariance inevitably waste a large number of queries to re-discover or overcome it. We, therefore, develop techniques to (i) reverse-engineer the preprocessor and then (ii) use this extracted information to attack the end-to-end system. Our preprocessors extraction method requires only a few hundred queries, and our preprocessor-aware attacks recover the same efficacy as when attacking the model alone. The code can be found at https://github.com/google-research/preprocessor-aware-black-box-attack.

연구 동기 및 목표

  • 실제 머신러닝 시스템에서 전처리기의 영향이 决定 기반 블랙박스 공격의 효과성에 미치는 영향을 조사하는 것.
  • 엔드 투 엔드 시스템에 전처리 구성 요소가 포함된 경우 표준 공격이 실패하는 이유를 규명하는 것.
  • 단지 수백 번의 쿼리만으로도 알려지지 않은 전처리기를 효율적으로 추출하는 방법을 개발하는 것.
  • 알 수 없는 전처리기를 고려한 공격을 설계하여 전처리기가 있는 시스템에서 공격의 전반적 효능을 복원하는 것.
  • 전처리기 추출이 공격 성공률 향상에 있어 하이퍼파rameter 튜닝보다 더 중요하다는 것을 입증하는 것.

제안 방법

  • 다양한 입력에 대한 시스템의 입력-출력 행동을 분석함으로써 쿼리 요청을 통해 전처리기를 역공학적으로 분석하는 방법.
  • Tramèr 등(2016)의 모델 추출 기법을 블랙박스 결정 쿼리에 맞게 변형하여 전처리기의 기능을 추론하는 방법.
  • 대상 시스템의 입력 변환 기능을 모방하는 서rogate 전처리기를 구축하는 방법.
  • 결정 기반 공격(예: HSJA, QEBA)을 전처리된 입력 공간에서 작동하도록 수정하여, 다시는 불변성을 탐색하기 위해 쿼리를 반복하지 않도록 하는 방법.
  • 전처리기의 변환에 강건한 적대적 예제를 향해 검색을 이끌어내는 편향된 기울기 전략을 적용하는 방법.
  • 다양한 적대적 예제에 걸쳐 전처리기 추출 비용을 분산시켜 효율성을 높이는 방법.

실험 결과

연구 질문

  • RQ1 resizing, 양자화, JPEG 압축과 같은 일반적인 전처리기가 결정 기반 블랙박스 공격의 성공률에 어떤 영향을 미치는가?
  • RQ2엔드 투 엔드 시스템에 전처리기가 포함된 경우 표준 결정 기반 공격가 왜 낮은 편향 노름을 달성하지 못하는가?
  • RQ3작은 수의 쿼리로 블랙박스 시스템의 전처리기를 역공학적으로 분석할 수 있는가?
  • RQ4전처리기 인식 공격은 독립형 모델에서의 성능과 동일한 성능을 회복할 수 있는가?
  • RQ5전처리기 추출이 공격 성공률 향상에 있어 하이퍼파rameter 튜닝보다 더 효과적인가?

주요 결과

  • 표준 결정 기반 공격는 전처리기가 포함된 시스템을 공격할 경우, 독립형 모델 대비 평균 ℓ₂ 왜곡이 최대 7배 증가한다.
  • 광범위한 하이퍼파rameter 튜닝과 쿼리 예산 증가에도 불구하고, 전처리기 인식이 없는 공격는 성능 격차를 메울 수 없다.
  • 제안된 전처리기 추출 방법은 resizing 및 JPEG 압축과 같은 일반적인 전처리기를 정확히 역공학적으로 분석하기 위해 단지 수백 번의 쿼리만으로도 충분하다.
  • 전처리기 인식 공격는 독립형 모델에서의 성능과 구분할 수 없을 정도로 적대적 편향 노름을 달성하여 공격의 전반적 효능을 효과적으로 복원한다.
  • Biased-Gradient 공격는 모든 인식되지 않은 공격보다 뛰어나며, 최적의 경우( JPEG 품질 60, 무관향 HSJA) 평균 왜곡을 최대 15배까지 감소시킨다.
  • 전처리기 인식 공격의 성능 향상은 쿼리 예산에 관계없이 일관되며, 500개의 쿼리에서도 평균 왜곡이 4.5배에서 4.8배까지 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.