Skip to main content
QUICK REVIEW

[논문 리뷰] Extraction of Complex DNN Models: Real Threat or Boogeyman?

Buse Gul Atli, Sebastian Szyller|arXiv (Cornell University)|2019. 10. 11.
Adversarial Robustness in Machine Learning참고 문헌 41인용 수 7
한 줄 요약

이 논문은 복잡한 DNN에 대한 최신의 모델 추출 공격인 Knockoff 넷의 실제 세계에서의 위협을 현실적인 조건에서 평가한다. 공격이 이상적인 가정 하에서는 작동하지만, API 출력이 클래스 레이블로 제한되거나 쿼리가 피해자 모델의 훈련 데이터 분포와 동일한 분포에서 유래할 경우 공격 성공률가 감소함을 확인한다. 이는 기존의 탐지 기법이 효과를 잃게 된다는 것을 의미한다. 저자들은 이상치 입력을 탐지하는 방식의 방어 기법을 제안하며, 이는 최대 99%의 탐지 정확도를 달성하지만, 더 현실적인 공격자가 여전히 탐지를 회피하고 모델을 성공적으로 추출할 수 있음을 보여준다.

ABSTRACT

Recently, machine learning (ML) has introduced advanced solutions to many domains. Since ML models provide business advantage to model owners, protecting intellectual property of ML models has emerged as an important consideration. Confidentiality of ML models can be protected by exposing them to clients only via prediction APIs. However, model extraction attacks can steal the functionality of ML models using the information leaked to clients through the results returned via the API. In this work, we question whether model extraction is a serious threat to complex, real-life ML models. We evaluate the current state-of-the-art model extraction attack (Knockoff nets) against complex models. We reproduce and confirm the results in the original paper. But we also show that the performance of this attack can be limited by several factors, including ML model architecture and the granularity of API response. Furthermore, we introduce a defense based on distinguishing queries used for Knockoff nets from benign queries. Despite the limitations of the Knockoff nets, we show that a more realistic adversary can effectively steal complex ML models and evade known defenses.

연구 동기 및 목표

  • Knockoff 넷을 통한 모델 추출이 복잡한 실제 DNN에 대해 현실적인 위협인지 평가하는 것.
  • 쿼리 분포, API 출력의 세분성, 서rogate 모델 아키텍처 등의 공격자 능력 변화가 공격 성공에 미치는 영향을 평가하는 것.
  • 내부 및 이상치 입력을 구분함으로써 Knockoff net 쿼리를 탐지하는 방어 기법을 설계하고 평가하는 것.
  • 공격자가 피해자 모델의 훈련 데이터와 동일한 분포에서 데이터를 사용할 경우 기존 탐지 기법이 여전히 효과를 가지는지 조사하는 것.
  • 감지되지 않는 추출 공격에 대비해 워터마킹이나 지문 기반 방어 기법을 우선적으로 고려해야 하는지 결정하는 것.

제안 방법

  • 원본 논문의 설정을 그대로 따라 복잡한 DNN 다섯 개에 대해 Knockoff 넷 공격을 재현하고 검증하였다.
  • 피해자 모델의 훈련 데이터와 쿼리 분포 간의 통계적 거리 측정을 사용해 쿼리가 내부 또는 이상치 입력인지 분류하는 방어 기법을 구현하였다.
  • 서rogate 모델 아키텍처와 API 출력 형식(확률 벡터 대 신뢰도 클래스 예측)의 변화에 따라 방어 기법의 탐지 성능을 평가하였다.
  • 쿼리 다양성, 데이터 분포 일치 여부, 모델 아키텍처 불일치가 공격 성공에 미치는 영향을 평가하기 위해 분석 실험을 수행하였다.
  • PRADA와 같은 기존 탐지 기법과 비교하여, Knockoff 넷에의 적합성과 회피에 대한 강건성에 초점을 맞췄다.
  • 공격자가 피해자 모델의 훈련 데이터와 동일한 분포에서 데이터를 사용할 경우, 탐지 기법이 효과를 잃게 되는 한계를 탐색하였다.

실험 결과

연구 질문

  • RQ1복잡한 DNN에 대해 Knockoff 넷 공격가 어떤 현실적인 조건에서 여전히 효과를 가지는가?
  • RQ2API 출력의 세분성이 감소할 경우(예: 전체 확률 벡터 대신 예측된 클래스만 반환할 경우), 모델 추출 공격의 성공률에 어떤 영향을 미치는가?
  • RQ3내부 및 이상치 입력을 구분함으로써 Knockoff net 쿼리를 효과적으로 탐지할 수 있는가? 이때 정상 사용자 기능에 영향을 주지 않는가?
  • RQ4공격자가 피해자 모델의 훈련 데이터와 동일한 분포에서 데이터를 확보할 경우, 기존 탐지 기법이 얼마나 효과를 잃는가?
  • RQ5방어 기법이 존재하는 상황에서도 효과적인 모델 추출이 가능할 수 있는가? 만약 그렇다면, 추가적인 대응 조치는 무엇이 필요한가?

주요 결과

  • Knockoff 넷 공격는 전체 확률 벡터 출력과 이상치 입력 쿼리를 사용할 경우 서rogate 모델에서 53.5%에서 94.8%의 정확도를 기록하며, 원래의 공격자 모델 조건 하에서 효과적임을 확인한다.
  • 제안된 방어 기법은 내부 및 이상치 입력을 구분함으로써 최대 99%의 악성 쿼리 탐지 정확도를 달성하여 이상적인 조건에서 높은 탐지 정확도를 입증한다.
  • API가 전체 확률 벡터 대신 예측된 클래스만 반환할 경우 공격 성공률가 크게 감소함을 확인하여, 이는 공격에 악영향을 미친다.
  • 공격자가 피해자 모델의 훈련 데이터와 동일한 분포에서의 레이블이 없는 데이터를 사용할 경우, 공격는 매우 효과적이며, 기존 탐지 기법(포함해 제안된 방어 기법)으로는 탐지되지 않게 된다.
  • 서rogate 모델 아키텍처와 피해자 모델 아키텍처 간의 불일치가 공격 성능을 추가로 저하시키며, 이는 아키텍처 유사성이 성공의 핵심 요소임을 시사한다.
  • 본 연구는 현실적인 공격자가 복잡한 DNN를 성공적으로 추출하고 탐지를 회피할 수 있음을 결론 내리며, 모델 소유권 보호를 위해 워터마킹과 같은 억제 기법이 필수적임을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.