[논문 리뷰] The Hidden Vulnerability of Watermarking for Deep Neural Networks.
이 논문은 지식이 없는 새로운 워터마크 제거 공격 기법을 제안하며, 워터마크 패턴을 숨기기 위한 사전처리 함수와 분포 외 데이터에 대한 미세조정 전략을 사용하여 최신 DNN 워터마킹 기법을 우회한다. 이 공격은 워터마킹 방법이나 학습 샘플에 대한 사전 지식 없이도 높은 성공률로 워터마크를 제거할 수 있다.
Watermarking has shown its effectiveness in protecting the intellectual property of Deep Neural Networks (DNNs). Existing techniques usually embed a set of carefully-crafted sample-label pairs into the target model during the training process. Then ownership verification is performed by querying a suspicious model with those watermark samples and checking the prediction results. These watermarking solutions claim to be robustness against model transformations, which is challenged by this paper. We design a novel watermark removal attack, which can defeat state-of-the-art solutions without any prior knowledge of the adopted watermarking technique and training samples. We make two contributions in the design of this attack. First, we propose a novel preprocessing function, which embeds imperceptible patterns and performs spatial-level transformations over the input. This function can make the watermark sample unrecognizable by the watermarked model, while still maintaining the correct prediction results of normal samples. Second, we introduce a fine-tuning strategy using unlabelled and out-of-distribution samples, which can improve the model usability in an efficient manner. Extensive experimental results indicate that our proposed attack can effectively bypass existing watermarking solutions with very high success rates.
연구 동기 및 목표
- 기존 DNN 워터마킹 기법의 모델 변환에 대한 주장된 강건성을 도전하기 위해.
- 워터마킹 방법이나 학습 샘플에 대한 사전 지식 없이도 작동하는 워터마크 제거 공격을 설계하기 위해.
- 정상 입력에 대한 모델 정확도를 유지하면서 워터마크된 모델이 워터마크 샘플을 인식하지 못하도록 하기 위해.
- 워터마크 제거 후 모델의 사용성을 향상시키기 위해 비표본, 분포 외 데이터를 효율적으로 미세조정하는 데 목적이 있다.
제안 방법
- 정상 입력에 워터마크 패턴을 인식할 수 없게 숨기고 워터마크 신호를 흐리게 만들기 위해 공간 수준의 변환을 적용하는 새로운 사전처리 함수를 도입한다.
- 사전처리 함수는 정상 샘플에 대해 정확한 예측을 보장하면서도 워터마크 샘플이 워터마크된 모델에 의해 인식되지 않도록 한다.
- 워터마크 제거 후 성능을 복구하기 위해 레이블이 없는 분포 외 샘플을 사용한 미세조정 전략을 적용한다.
- 원본 워터마킹 학습 데이터에 대한 액세스나 워터마킹 기법에 대한 지식이 필요하지 않다.
- 일반화 능력을 입증하기 위해 다양한 DNN 아키텍처와 워터마킹 기법을 대상으로 평가한다.
- 공격 워크플로우는 워터마크 입력을 사전처리하고, 모델 적응을 통해 워터마크를 제거하며, 모델 유효성을 유지하기 위해 미세조정을 수행하는 것으로 구성된다.
실험 결과
연구 질문
- RQ1워터마킹 기법이나 학습 샘플에 대한 사전 지식 없이도 워터마크 제거 공격을 설계할 수 있는가?
- RQ2인식할 수 없는 사전처리 함수가 모델 정확도를 유지하면서 워터마크 패턴을 얼마나 효과적으로 숨길 수 있는가?
- RQ3분포 외 데이터에 대한 미세조정이 워터마크 제거 후 모델 사용성을 얼마나 효과적으로 복구하는가?
- RQ4제안된 공격이 다양한 DNN 모델을 통해 최신 워터마킹 기법을 높은 성공률로 우회할 수 있는가?
주요 결과
- 제안된 공격은 최신 DNN 워터마킹 기법에서 워터마크를 제거하는 데 매우 높은 성공률를 달성한다.
- 워터마킹 방법이나 학습 샘플에 대한 지식 없이도 공격가 워터마킹을 성공적으로 우회한다.
- 사전처리 함수는 정상 입력에 대해 정확한 예측을 유지하면서도 워터마크 샘플이 워터마크된 모델에 의해 인식되지 않도록 한다.
- 레이블이 없는 분포 외 샘플을 사용한 미세조정은 워터마크 제거 후 모델 사용성을 효과적으로 복구한다.
- 광범위한 실험을 통해 공격의 효과성이 다양한 DNN 아키텍처와 워터마킹 기법에 걸쳐 확인된다.
- 공격는 다양한 워터마킹 방어에 대해 강건성과 뛰어난 일반화 능력을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.