Skip to main content
QUICK REVIEW

[논문 리뷰] SoK: How Robust is Image Classification Deep Neural Network Watermarking? (Extended Version)

Nils Lukas, Edward Jiang|arXiv (Cornell University)|2021. 08. 11.
Advanced Steganography and Watermarking Techniques참고 문헌 63인용 수 5
한 줄 요약

이 논문은 이미지 분류를 위한 11종의 딥 네ural 네트워크 워터마킹 기법에 대해 포괄적인 제거 공격에 대한 내성에 대해 체계적으로 평가한다. 연구 결과, 적응형 공격—특히 통합된 전이 학습과 레이블 스무딩—이 모든 워터마크를 제거할 수 있음을 입증하여 현재의 내성 평가 방법론에 심각한 결함이 있음을 드러낸다.

ABSTRACT

Deep Neural Network (DNN) watermarking is a method for provenance verification of DNN models. Watermarking should be robust against watermark removal attacks that derive a surrogate model that evades provenance verification. Many watermarking schemes that claim robustness have been proposed, but their robustness is only validated in isolation against a relatively small set of attacks. There is no systematic, empirical evaluation of these claims against a common, comprehensive set of removal attacks. This uncertainty about a watermarking scheme's robustness causes difficulty to trust their deployment in practice. In this paper, we evaluate whether recently proposed watermarking schemes that claim robustness are robust against a large set of removal attacks. We survey methods from the literature that (i) are known removal attacks, (ii) derive surrogate models but have not been evaluated as removal attacks, and (iii) novel removal attacks. Weight shifting and smooth retraining are novel removal attacks adapted to the DNN watermarking schemes surveyed in this paper. We propose taxonomies for watermarking schemes and removal attacks. Our empirical evaluation includes an ablation study over sets of parameters for each attack and watermarking scheme on the CIFAR-10 and ImageNet datasets. Surprisingly, none of the surveyed watermarking schemes is robust in practice. We find that schemes fail to withstand adaptive attacks and known methods for deriving surrogate models that have not been evaluated as removal attacks. This points to intrinsic flaws in how robustness is currently evaluated. We show that watermarking schemes need to be evaluated against a more extensive set of removal attacks with a more realistic adversary model. Our source code and a complete dataset of evaluation results are publicly available, which allows to independently verify our conclusions.

연구 동기 및 목표

  • 최근에 제안된 DNN 워터마킹 기법들이 광범위하고 표준화된 제거 공격 집합에 대해 내성적으로 얼마나 견고한지 체계적으로 평가하기 위해.
  • 모델 수정, 입력 전처리, 모델 추출 기법을 포함한 기존 및 신규 제거 공격을 식별하고 분류하기 위해.
  • 현재의 내성 평가 관행—특히 약한 또는 비적응형 공격자를 사용하는 방식—에 내재된 결함을 드러내기 위해.
  • 향후 워터마킹 기법의 벤치마킹을 향상시키기 위해 공개된 도구상자를 포함한 표준화되고 재현 가능한 평가 프레임워크를 제안하기 위해.
  • 결정 임계값 유도 및 파rameter 민감도 분석을 포함한 워터마킹 내성 평가에 실용적인 지침을 제공하기 위해.

제안 방법

  • 모델 독립형, 모델 종속형, 파라미터 인코딩, 활성 워터마킹을 포함한 워터마킹 기법의 분류 체계와 모델 수정, 입력 전처리, 모델 추출을 포함한 제거 공격의 분류 체계를 수립하였다.
  • CIFAR-10과 ImageNet에서 모든 11종의 워터마킹 기법과 29종의 제거 공격을 표준화하여 평가하기 위해 워터마크 내성 도구상자(WRT)를 구현하였다.
  • 나시 균형(Nash equilibrium)에서 내성 평가를 위해 워터마킹 기법과 제거 공격의 핵심 파라미터에 대한 분석 연구를 수행하였다.
  • 특히 적대적 예제에 의존하는 기법을 위한 결정 임계값 유도를 위한 경험적 방법을 제안하였다.
  • 재학습에서의 런타임 대비 런타임 측정을 통해 공격의 효율성과 실용 가능성을 평가하였다.
  • 다양한 공격(예: 전이 학습 + 레이블 스무딩)을 조합하여 누적 효과를 테스트하고 주요 공격 조합을 식별하였다.

실험 결과

연구 질문

  • RQ1현재 제안된 DNN 워터마킹 기법들은 포괄적이고 적응형인 제거 공격 집합에 대해 내성적인가?
  • RQ2모델 추출, 모델 수정, 입력 전처리 공격는 DNN에서 워터마크를 얼마나 효과적으로 제거하는가?
  • RQ3다양한 기술을 융합한 복합 공격는 다양한 데이터셋과 모델에서 모든 워터마크를 제거할 수 있는가?
  • RQ4런타임, 파라미터 민감도, 결정 임계값 유도 측면에서 현재 워터마킹 기법의 실용적 한계는 무엇인가?
  • RQ5향후 연구에서 내성은 어떻게 더 철저하게 평가할 수 있으며, 어떤 방법론적 개선이 필요할까?

주요 결과

  • 조사한 11종의 워터마킹 기법 중 어느 것도 모든 공격에 대해 내성적이지 않으며, 적응형 또는 복합 공격 전략에 의해 모두 무력화됨을 확인하였다.
  • 모델 추출 공격—특히 전이 학습—이 가장 효과적인 카테고리였으며, CIFAR-10에서는 모든 워터마크를 제거하였다.
  • 전이 학습과 레이블 스무딩을 조합한 공격은 CIFAR-10과 ImageNet 양쪽에서 모두 11종의 워터마크를 성공적으로 제거하였다.
  • ImageNet에서는 단일 공격가 주도적이지는 않았지만, 모델 추출 및 수정 공격이 특히 복합 공격에서 높은 효과를 보였다.
  • 제거 공격의 런타임은 종종 재학습에서의 런타임보다 상당히 낮아, 실용적 타당성을 확인하였다.
  • 많은 워터마킹 기법은 전체 테스트 정확도 지표가 반영하지 못하는 클래스별 정확도 저하와 같은 의도하지 않은 부작용을 야기한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.