Skip to main content
QUICK REVIEW

[논문 리뷰] ES Attack: Model Stealing against Deep Neural Networks without Data Hurdles

Xiaoyong Yuan, Lei Ding|arXiv (Cornell University)|2020. 09. 21.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

ES 공격는 기계 학습을 서비스로 제공하는(MLaaS) API에서 피해자 모델의 학습 데이터나 보조 데이터에 접근할 필요 없이 기능적으로 동일한 딥 뉴럴 네트워크(DNN)를 재구성할 수 있는 새로운 모델 도용 프레임워크이다. 반복적으로 합성 데이터를 생성하고, 지식 정착을 통해 대체 모델을 정교화함으로써 ES 공격는 기준 공격 대비 평균 44.57% 높은 정확도를 달성하며 대부분의 기존 방어 조치를 우회한다.

ABSTRACT

Deep neural networks (DNNs) have become the essential components for various commercialized machine learning services, such as Machine Learning as a Service (MLaaS). Recent studies show that machine learning services face severe privacy threats - well-trained DNNs owned by MLaaS providers can be stolen through public APIs, namely model stealing attacks. However, most existing works undervalued the impact of such attacks, where a successful attack has to acquire confidential training data or auxiliary data regarding the victim DNN. In this paper, we propose ES Attack, a novel model stealing attack without any data hurdles. By using heuristically generated synthetic data, ES Attack iteratively trains a substitute model and eventually achieves a functionally equivalent copy of the victim DNN. The experimental results reveal the severity of ES Attack: i) ES Attack successfully steals the victim model without data hurdles, and ES Attack even outperforms most existing model stealing attacks using auxiliary data in terms of model accuracy; ii) most countermeasures are ineffective in defending ES Attack; iii) ES Attack facilitates further attacks relying on the stolen model.

연구 동기 및 목표

  • 피해자 모델의 학습 데이터나 보조 데이터에 접근이 필요한 모델 도용 공격에 존재하는 핵심적 격차를 해결하기 위해.
  • 학습 데이터 없이 오직 API 쿼리와 응답 레이블만을 사용하는 데이터 프리 모델 도용 프레임워크를 개발하기 위해.
  • 데이터 장벽 없이 DNN을 도용하는 데서 ES 공격의 효과성을 평가하고 기존 방법과 비교하기 위해.
  • 현재의 방어 메커니즘이 이 새로운 공격 패러다임에 얼마나 취약한지 평가하기 위해.
  • 도용된 모델을 사용해 블랙박스 적대적 공격을 더 효과적으로 수행할 수 있는 임계 하위 위험을 입증하기 위해.

제안 방법

  • ES 공격는 반복적인 E-단계와 S-단계 프로세스를 사용한다: E-단계에서는 지식 정착을 통해 피해자 모델의 응답에서 얻은 소프트 레이블을 사용해 합성 데이터로 대체 모델을 훈련시킨다.
  • S-단계에서는 대체 모델을 피해자 모델의 대리로 사용하여 예측 클래스에 대한 모델의 신뢰도를 극대화하도록 입력 노이즈를 최적화함으로써 합성 데이터를 생성한다.
  • 합성 데이터는 피해자 모델의 결정 경계를 더 잘 반영하고 다양성을 향상시키기 위해 다중 반복 동안 정교화된다.
  • 지식 정착은 피해자 모델의 소프트 레이블(로짓)을 사용하여 대체 모델에 기능적 행동을 전달한다.
  • 공격는 피해자 모델의 기울기 계산에 의존하지 않으며, 대신 대체 모델을 사용해 데이터 최적화를 위한 기울기를 생성한다.
  • 이 프레임워크는 아키텍처에 관계없이 작동하며 피해자 모델의 추론 API에 대한 블랙박스 액세스만 필요로 한다.

실험 결과

연구 질문

  • RQ1피해자 모델의 학습 데이터나 보조 데이터에 접근하지 않고도 모델 도용 공격가 DNN을 성공적으로 재구성할 수 있는가?
  • RQ2보조 데이터에 의존하는 공격 대비 데이터 프리 모델 도용 공격의 성능은 대체 모델 정확도 측면에서 어떻게 비교되는가?
  • RQ3기존의 방어 메커니즘은 ES 공격와 같은 데이터 프리 모델 도용 공격에 얼마나 효과적인가?
  • RQ4도용된 모델을 사용해 화이트박스 공격보다 더 효과적인 블랙박스 적대적 공격을 수행할 수 있는가?
  • RQ5ES 공격가 생성한 합성 데이터의 품질과 다양성은 실제 또는 보조 데이터 세트와 비교해 어떠한가?

주요 결과

  • ES 공격는 학습 데이터나 보조 데이터 없이 MLaaS 제공자로부터 DNN을 성공적으로 도용했으며, 보조 데이터를 사용하는 기준 공격 대비 평균 44.57% 높은 정확도 향상을 달성했다.
  • ES 공격가 생성한 합성 데이터는 보조 데이터 세트보다 더 높은 품질과 다양성을 보이며, 이는 대체 모델 성능 향상에 기여한다.
  • 대부분의 기존 방어 조치, 예를 들어 쿼리 패턴 탐지나 학습률 모니터링은 ES 공격에 효과가 없다.
  • 도용된 모델을 사용해 블랙박스 적대적 공격를 수행할 수 있으며, 이는 때로는 화이트박스 공격보다 성공률가 더 높을 수 있다. 이는 모델 도용의 위험성을 입증한다.
  • 피해자 모델의 아키텍처나 파라미터가 알려지지 않은 상태에서도 ES 공격를 통해 훈련된 대체 모델은 피해자 모델과 높은 기능적 동일성을 달성한다.
  • 이 공격 프레임워크는 여러 이미지 분류 데이터 세트에서 강력한 성능을 보이며, 아키텍처나 하이퍼파라미터 지식이 없어도 효과를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.