Skip to main content
QUICK REVIEW

[논문 리뷰] Copy, Right? A Testing Framework for Copyright Protection of Deep Learning Models

Jialuo Chen, Jingyi Wang|arXiv (Cornell University)|2021. 12. 10.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 딥러닝 모델의 저작권 보호를 위한 비침습적이고 효율적이며 유연한 테스팅 프레임워크인 DeepJudge를 제안한다. 다양한 지표와 적응형 테스트 케이스 생성을 통해 모델 유사도를 정량적으로 측정하며, 미세조정, 프루닝 및 추출 공격 상황에서도 높은 정확도와 적응형 공격에 대한 강건성을 바탕으로 도난당한 모델을 성공적으로 탐지한다.

ABSTRACT

Deep learning (DL) models, especially those large-scale and high-performance ones, can be very costly to train, demanding a great amount of data and computational resources. Unauthorized reproduction of DL models can lead to copyright infringement and cause huge economic losses to model owners. Existing copyright protection techniques are mostly based on watermarking, which embeds an owner-specified watermark into the model. While being able to provide exact ownership verification, these techniques are 1) invasive, as they need to tamper with the training process, which may affect the utility or introduce new security risks; 2) prone to adaptive attacks that attempt to remove the watermark; and 3) not robust to the emerging model extraction attacks. Latest fingerprinting work, though being non-invasive, also falls short when facing the diverse and ever-growing attack scenarios. In this paper, we propose a novel testing framework for DL copyright protection: DEEPJUDGE. DEEPJUDGE quantitatively tests the similarities between two DL models: a victim model and a suspect model. It leverages a diverse set of testing metrics and test case generation methods to produce a chain of supporting evidence to help determine whether a suspect model is a copy of the victim model. Advantages of DEEPJUDGE include: 1) non-invasive, as it works directly on the model and does not tamper with the training process; 2) efficient, as it only needs a small set of test cases and a quick scan of models; 3) flexible, as it can easily incorporate new metrics or generation methods to obtain more confident judgement; and 4) fairly robust to model extraction and adaptive attacks. We verify the effectiveness of DEEPJUDGE under typical copyright infringement scenarios, including model finetuning, pruning and extraction, via extensive experiments on both image and speech datasets with a variety of model architectures.

연구 동기 및 목표

  • 딥러닝 모델의 무단 복제로부터 보호하기 위해 침습적 워터마킹과 취약한 지문 기반 기법의 한계를 해결하기 위해.
  • 모델 추출 및 적응형 수정 공격을 포함한 다양한 공격에 강건하며, 훈련 과정을 변경하지 않는 비침습적이고 효율적인 저작권 보호 방법을 개발하기 위해.
  • 미세조정, 프루닝 및 전이 학습과 같은 다양한 공격 시나리오에서 도난당한 모델을 탐지할 수 있도록 하기 위해.
  • 새로운 테스트 지표 및 테스트 케이스 생성 기법의 통합을 지원하는 유연하고 확장 가능한 프레임워크를 제공하기 위해.
  • 모델 소유자가 훈련 과정을 수정하지 않고도 소유권을 검증할 수 있는 실용적이고 오픈소스 솔루션을 제공하기 위해.

제안 방법

  • DeepJudge는 정확도, 강건성 거리, 젠슨-쇼난 분산, 기타 행동 유사도 측정 지표를 포함한 다양한 지표를 사용하여 피해자 모델과 의심 모델 간의 유사도를 다수 수준에서 평가하는 다층 테스팅 프레임워크를 활용한다.
  • 효율적인 시드 기반 테스트 케이스 생성을 통해 다양한 입력 영역에서의 모델 동작을 탐색함으로써 모델 출력의 신속한 스캔을 가능하게 한다.
  • 블랙박스 및 화이트박스 테스팅을 모두 지원하며, 전이 학습 또는 프루닝 이후의 모델 아키텍처와 출력 차원에 적응한다.
  • 적응형 공격(예: 적대적 훈련 또는 모델 추출) 상황에서 탐지 민감도를 유지하기 위해 테스트 케이스 시드를 동적으로 업데이트한다.
  • 다양한 지표를 통한 증거 체인을 계산하며, 임계값(예: τλ)을 사용하여 의심 모델이 복제인지 여부를 결정한다.
  • 새로운 테스트 지표 및 생성 전략은 쉽게 통합 가능하여 탐지의 강건성과 신뢰도를 향상시킨다.

실험 결과

연구 질문

  • RQ1훈련 과정을 수정하지 않고도 비침습적 테스팅 프레임워크가 모델 도난을 효과적으로 탐지할 수 있는가?
  • RQ2적대적 훈련, 모델 추출, 미세조정과 같은 적응형 공격에 대해 프레임워크의 강건성은 어떠한가?
  • RQ3다양한 모델 아키텍처와 데이터셋에서 프레임워크가 높은 탐지 정확도를 유지할 수 있는가?
  • RQ4모델 구조가 변경된 전이 학습 시나리오에서 프레임워크의 성능은 어떠한가?
  • RQ5단일 지표 접근 방식에 비해 다중 테스트 지표의 통합이 탐지 신뢰도를 향상시킬 수 있는가?

주요 결과

  • SVHN에서 5개 클래스 분류 작업을 통해 전이 학습 공격 탐지에서 100% AUC를 기록하여 강력한 탐지 능력을 입증하였다.
  • 블랙박스 테스팅에서 DeepJudge는 Adapt-B 공격에 의한 6개의 적응형 공격 모델 중 4개를 정확히 복제로 식별하였으며, 탐지 임계값 τλ = 0.816를 사용하였다.
  • 화이트박스 테스팅에서는 Adapt-W 공격에 의한 6개 모델 중 4개가 복제로 표시되었으며, 임계값 τλ = 0.537을 사용하였다.
  • 적대적 훈련 상황에서도 프레임워크는 높은 탐지 성능을 유지하였으며, 6개 모델 중 4개가 정확히 복제로 식별되었고 AUC = 1.0을 기록하였다.
  • 부정적 대조 모델들(예: Neg-1 및 Neg-2)은 일관되게 복제로 분류되지 않았으며, 임계값을 크게 초월하는 값으로 나타나 거짓 양성률이 낮음을 시사하였다.
  • DeepJudge는 모델 추출 공격에 대해서도 강건성을 보였으며, API 기반 쿼리로부터 유도된 의심 모델의 경우에도 탐지 성능이 유지되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.