Skip to main content
QUICK REVIEW

[논문 리뷰] Are You Stealing My Model? Sample Correlation for Fingerprinting Deep Neural Networks

Jiyang Guan, Jian Liang|arXiv (Cornell University)|2022. 10. 21.
Adversarial Robustness in Machine Learning인용 수 10
한 줄 요약

이 논문은 표본 상관관계를 사용하여 도난당한 딥 뉴럴 네트워크를 탐지하는 새로운 모델 지문 기반 방법인 SAC을 제안한다. 정상 표본의 잘못 분류된 예 또는 CutMix 증강 표본을 활용하여 원본 모델과 의심 모델 간의 상관관계 차이를 계산함으로써, SAC는 적대적 훈련이나 전이 학습을 포함한 다양한 공격에 대해 최신 기술 수준의 AUC 성능(최대 1.0)을 달성한다. 이는 유사 모델 훈련이나 적대적 예제 생성이 필요로 하지 않는다.

ABSTRACT

An off-the-shelf model as a commercial service could be stolen by model stealing attacks, posing great threats to the rights of the model owner. Model fingerprinting aims to verify whether a suspect model is stolen from the victim model, which gains more and more attention nowadays. Previous methods always leverage the transferable adversarial examples as the model fingerprint, which is sensitive to adversarial defense or transfer learning scenarios. To address this issue, we consider the pairwise relationship between samples instead and propose a novel yet simple model stealing detection method based on SAmple Correlation (SAC). Specifically, we present SAC-w that selects wrongly classified normal samples as model inputs and calculates the mean correlation among their model outputs. To reduce the training time, we further develop SAC-m that selects CutMix Augmented samples as model inputs, without the need for training the surrogate models or generating adversarial examples. Extensive results validate that SAC successfully defends against various model stealing attacks, even including adversarial training or transfer learning, and detects the stolen models with the best performance in terms of AUC across different datasets and model architectures. The codes are available at https://github.com/guanjiyang/SAC.

연구 동기 및 목표

  • 적대적 예제에 의존하는 기존 모델 지문 기반 기법의 한계를 해결하고, 적대적 훈련이나 전이 학습 상황에서도 성능을 유지하지 못하는 문제를 해결한다.
  • 모델 훈련 과정에 간섭하지 않거나 성능을 떨어뜨리지 않는 강건한 모델 소유권 검증 기법을 개발한다.
  • 유사 모델 훈련이나 적대적 예제 생성이 필요 없어, 지문 기반의 시간과 계산 자원 소모를 줄인다.
  • 다양한 아키텍처와 데이터셋, 특히 전이 학습이나 적대적 미세조정과 같은 도전적인 상황에서도 효과적인 모델 도난 공격 탐지 기능을 제공한다.

제안 방법

  • 원본 모델과 의심 모델 간의 표본 간 쌍별 출력 상관관계를 기반으로 하는 새로운 지문 지표로 표본 상관관계(SAC)를 제안한다.
  • SAC-w를 도입하여 원본 모델에서 잘못 분류된 정상 표본을 입력으로 사용해 상관관계 차이를 계산함으로써, 적대적 예제에 의존하지 않도록 한다.
  • SAC-m을 개발하여 CutMix 증강 표본을 입력으로 사용함으로써, 유사 모델 훈련이나 적대적 예제 생성이 필요 없도록 한다.
  • 도난당한 모델와 아닌 모델 간의 갭을 최대화하기 위해 코사인 유사도를 상관관계 함수로 사용한다.
  • 선택된 표본의 모델 출력 간 평균 상관관계를 계산하여 지문을 형성하고, 이 상관관계 차이를 탐지 신호로 활용한다.
  • 모델 훈련 과정을 수정하지 않고 방법을 적용함으로써 원래 정확도를 유지하고 후행 배포가 가능하도록 한다.

실험 결과

연구 질문

  • RQ1모델 출력 간 표본 상관관계가 도난당한 딥 뉴럴 네트워크를 탐지하기 위한 강건하고 이식 가능한 지문으로서 기능할 수 있는가?
  • RQ2이전의 적대적 기반 기법이 실패하는 상황인 적대적 훈련과 전이 학습 하에서 SAC-w는 어떻게 성능을 내는가?
  • RQ3CutMix 증강 표본이 지문 기반에 적대적 예제를 효과적으로 대체할 수 있는가? 이는 계산 비용을 줄이는 데 기여하는가?
  • RQ4입력 표본의 선택(예: 잘못 분류된 표본 대비 정상 표본)이 탐지 성능과 표본 효율성에 어떤 영향을 미치는가?
  • RQ5다양한 상관관계 함수(예: 코사인 유사도 대비 가우시안 RBF)의 선택이 탐지 강건성과 AUC 성능에 어떤 영향을 미치는가?

주요 결과

  • SAC는 대부분의 모델 아키텍처와 데이터셋에서, 적대적 훈련과 전이 학습 조건에서도 완벽한 AUC 1.0을 달성한다.
  • SAC-m는 지문 기반 시간을 단 4.45초로 단축시켜 CAE 방법 대비 5,738배 빠른 성능 향상을 보이며, 뚜렷한 효율성 향상을 입증한다.
  • 오직 50개의 잘못 분류된 표본만으로도 SAC-w는 AUC > 0.99를 달성하여, 소수의 표본 조건에서도 뛰어난 성능을 보인다.
  • 특히 방어자 데이터가 제한된 상황에서 SAC-m은 SAC-w 및 기타 기준 기법보다 정확도와 효율성 면에서 뛰어난 성능을 보인다.
  • 코사인 유사도가 상관관계 함수로 사용되었을 때 도난당한 모델과 아닌 모델 간의 갭이 가장 크게 나타나, 가장 효과적인 선택으로 밝혀졌다.
  • 모델 정제, 미세조정, 모델 추출 공격 등 다양한 공격 상황에서도 AUC 값이 항상 0.99 이상으로 유지되어 강건함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.