Skip to main content
QUICK REVIEW

[논문 리뷰] MEGEX: Data-Free Model Extraction Attack against Gradient-Based Explainable AI

Takayuki Miura, Hasegawa Satoshi|arXiv (Cornell University)|2021. 07. 19.
Adversarial Robustness in Machine Learning참고 문헌 21인용 수 11
한 줄 요약

MEGEX는 기울기 기반 설명 가능한 AI에 대한 데이터 없음 모델 추출 공격을 제안하며, 모델 설명을 활용해 생성 모델을 더 효율적으로 훈련시켜 이전 방법 대비 쿼리 비용을 6/7 감소시킨다. CIFAR-10과 SVHN에서 각각 92.3% 및 92.5%의 클론 모델 정확도를 달성하며, 피해자 모델 정확도의 97%와 98%에 도달하여 해석 가능성과 모델 보안 간의 심각한 상충관계를 입증한다.

ABSTRACT

The advance of explainable artificial intelligence, which provides reasons for its predictions, is expected to accelerate the use of deep neural networks in the real world like Machine Learning as a Service (MLaaS) that returns predictions on queried data with the trained model. Deep neural networks deployed in MLaaS face the threat of model extraction attacks. A model extraction attack is an attack to violate intellectual property and privacy in which an adversary steals trained models in a cloud using only their predictions. In particular, a data-free model extraction attack has been proposed recently and is more critical. In this attack, an adversary uses a generative model instead of preparing input data. The feasibility of this attack, however, needs to be studied since it requires more queries than that with surrogate datasets. In this paper, we propose MEGEX, a data-free model extraction attack against a gradient-based explainable AI. In this method, an adversary uses the explanations to train the generative model and reduces the number of queries to steal the model. Our experiments show that our proposed method reconstructs high-accuracy models -- 0.97$ imes$ and 0.98$ imes$ the victim model accuracy on SVHN and CIFAR-10 datasets given 2M and 20M queries, respectively. This implies that there is a trade-off between the interpretability of models and the difficulty of stealing them.

연구 동기 및 목표

  • 데이터 없음 모델 추출 공격의 맥락에서 기울기 기반 설명 가능한 AI의 보안 위험을 조사하는 것.
  • 기존 데이터 없음 모델 추출 방법의 높은 쿼리 비용 문제를 해결하기 위해 모델 설명을 활용해 생성 모델 훈련 효율성을 향상시키는 것.
  • 바닐라 기울기와 같은 해석 메커니즘이 의도치 않게 모델 보안을 약화시켜 추출 공격에 취약하게 만들지 여부를 평가하는 것.
  • 생성 모델 훈련을 위한 지도로 설명을 활용하는 새로운 공격 프레임워크를 제안하고 검증하는 것.
  • 모델 해석 가능성과 데이터 없음 모델 추출에 대한 취약성 간의 상충관계를 정량화하는 것.

제안 방법

  • 악성 사용자는 피해자 모델의 기울기 설명(바닐라 기울기)을 사용하여 생성 모델 훈련을 위한 정확한 기울기를 계산한다.
  • 이 기울기를 사용해 실제 입력의 분포와 유사한 입력 데이터를 합성하는 생성 모델을 훈련시킨다.
  • 생성된 데이터에 대해 피해자 모델의 예측을 사용하여 클론 모델을 훈련시키며, 손실 함수로 ℓ₁ 노름과 KL 발산을 포함한다.
  • 두 단계 최적화를 적용한다: 먼저 생성 모델을 현실적인 입력을 생성하도록 훈련시키고, 그 다음 클론 모델이 피해자 모델의 행동을 모방하도록 훈련시킨다.
  • SVHN에 대해 200만 개, CIFAR-10에 대해 2000만 개의 쿼리 예산을 사용하며, 수렴을 향상시키기 위해 적응형 학습률과 스케줄러를 적용한다.
  • 기존의 데이터 없음 방법에 비해 정확한 기울기 정보를 활용함으로써 쿼리 수를 6/7 감소시켜 개선한다.
Figure 1: Model Extraction Attack.
Figure 1: Model Extraction Attack.

실험 결과

연구 질문

  • RQ1기울기 기반 설명 가능한 AI 메커니즘은 데이터 없음 모델 추출 공격에서 필요한 쿼리 수를 줄이는 데 악용될 수 있는가?
  • RQ2모델 설명을 활용할 경우 모델 추출 공격에서 생성된 데이터의 품질은 어떻게 향상되는가?
  • RQ3클론 모델 정확도와 쿼리 효율성 측면에서 MEGEX와 기존의 데이터 없음 모델 추출 방법 간의 성능 격차는 무엇인가?
  • RQ4설명에서 유도된 정확한 기울기를 사용할 경우 클론 모델의 수렴 속도와 일반화 능력이 향상되는가?
  • RQ5데이터 없음 모델 추출의 맥락에서 모델 해석 가능성과 모델 보안 간의 상충관계는 무엇인가?

주요 결과

  • MEGEX는 2000만 개의 쿼리로 CIFAR-10에서 92.3%의 클론 모델 정확도를 달성하였으며, 이는 피해자 모델의 95.5% 정확도의 97%에 해당한다.
  • SVHN에서는 200만 개의 쿼리로 92.5%의 클론 정확도를 달성하였으며, 피해자 모델의 94.8% 정확도의 98%에 해당한다.
  • MEGEX는 동일한 쿼리 예산에서 기준선인 DFME 방법보다 뛰어나며, CIFAR-10에서 80.6%의 정확도를 기록한다.
  • 기존의 데이터 없음 모델 추출 기법 대비 쿼리 수를 6/7 감소시켰다.
  • MEGEX와 DFME 모두 ℓ₁ 손실을 사용할 경우 높은 성능을 보였지만, KL 발산 손실은 기울기 소실 현상으로 인해 성능에 제한을 받는다.
  • 결과는 상당한 상충관계를 시사한다: 기울기 설명을 통한 모델 해석 가능성 증가는 모델을 데이터 없음 추출 공격에 더 취약하게 만들며, 이는 보안 취약성을 증가시킨다.
Figure 2: Data-Free Model Extraction Attack.
Figure 2: Data-Free Model Extraction Attack.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.