[논문 리뷰] HufuNet: Embedding the Left Piece as Watermark and Keeping the Right Piece for Ownership Verification in Deep Neural Networks
HufuNet는 모델의 왼쪽 반쪽에 경량 워터마크(EPH)를 통합하면서도 소유주 측에서 해당 비밀정보(SPHe)를 유지하여 소유권 검증을 수행하는 새로운 DNN 워터마킹 기법을 제안한다. 이 기법은 미세조정, 양자르기, 커널 조작 및 악성 예측 샘플을 이용한 위조 주장에 대해 높은 강건성을 확보하면서도 기준 모델에서 성능 저하가 거의 발생하지 않는다.
Due to the wide use of highly-valuable and large-scale deep neural networks (DNNs), it becomes crucial to protect the intellectual property of DNNs so that the ownership of disputed or stolen DNNs can be verified. Most existing solutions embed backdoors in DNN model training such that DNN ownership can be verified by triggering distinguishable model behaviors with a set of secret inputs. However, such solutions are vulnerable to model fine-tuning and pruning. They also suffer from fraudulent ownership claim as attackers can discover adversarial samples and use them as secret inputs to trigger distinguishable behaviors from stolen models. To address these problems, we propose a novel DNN watermarking solution, named HufuNet, for protecting the ownership of DNN models. We evaluate HufuNet rigorously on four benchmark datasets with five popular DNN models, including convolutional neural network (CNN) and recurrent neural network (RNN). The experiments demonstrate HufuNet is highly robust against model fine-tuning/pruning, kernels cutoff/supplement, functionality-equivalent attack, and fraudulent ownership claims, thus highly promising to protect large-scale DNN models in the real-world.
연구 동기 및 목표
- 기존 DNN 워터마킹 기법이 모델의 미세조정, 양자르기 및 악성 예측 샘플 기반의 위조 소유권 주장에 취약한 점을 해결하기 위해.
- 높은 모델 성능을 유지하면서도 일반적인 모델 변조 공격에 대해 강력한 강건성을 확보하는 워터마킹 메커니즘을 설계하기 위해.
- 악성 예측 샘플을 트리거로 활용하여 유효한 워터마크를 위조하는 공격자들을 방지하기 위해.
- 통계 분석이나 역공학 기법에 노출되지 않고도 신뢰할 수 있는 블라인드 소유권 검증을 가능하게 하기 위해.
- 실세계 배포 환경에서 대규모 DNN 지적재산권을 보호하기 위한 실용적이고 안전하며 은밀한 솔루션을 제공하기 위해.
제안 방법
- HufuNet는 워터마크를 두 부분으로 나눈다: DNN 모델의 파라미터에 통합되는 Hufu의 임베디드 조각(EPH), 그리고 모델 소유주가 안전하게 보관하는 Hufu의 비밀 조각(SPHe).
- EPH는 DNN의 거의 모든 레이어에 분산 배치되어 파라미터 공간의 소량을 차지함으로써 은밀성과 통계 분석에 대한 저항력을 확보한다.
- 소유권 검증은 SPH를 비밀 키로 사용하여 특정 입력(비밀 정보 SPH에서 유도됨)에 대한 모델 출력을 기대 출력과 비교함으로써 수행된다.
- 이 기법은 커널 컷오프/보완 공격, 기능적으로 동일한 공격, 그리고 큰 학습률과 레이블 없는 데이터를 사용한 미세조정 공격에도 강건하도록 설계되었다.
- 백도어 트리거나 레이블이 부여된 악성 예측 샘플에 의존하지 않아 악성 예측 샘플을 이용한 위조 주장 위험을 감소시킨다.
- 5개의 인기 있는 DNN 아키텍처(CNNs 및 RNNs)와 4개의 기준 데이터셋을 대상으로 평가하여 강건성과 정밀도를 검증하였다.
실험 결과
연구 질문
- RQ1모델의 미세조정과 양자르기 후에도 성능 저하 없이 워터마킹 기법이 효과를 유지할 수 있는가?
- RQ2악성 예측 샘플을 가짜 트리거로 사용하는 공격에 대해 기법이 저항할 수 있는가?
- RQ3레이어 파라미터 분산의 통계 분석을 통해 탐지되지 않도록 워터마크를 삽입할 수 있는가?
- RQ4모델 정확도를 유지하면서도 구조를 변경하는 기능적으로 동일한 공격에 대해 기법의 효과는 어떠한가?
- RQ5모델 정밀도를 훼손하지 않고 다양한 DNN 아키텍처와 데이터셋에 대해 기법이 강건하게 적용될 수 있는가?
주요 결과
- HufuNet는 테스트된 5개의 DNN 모델과 4개의 기준 데이터셋에서 모두 모델의 미세조정과 양자르기에 대해 매우 높은 강건성을 보였으며, 성능 저하가 거의 없었다.
- 기법은 악성 예측 샘플을 가짜 트리거로 사용하는 공격에 성공적으로 저항하여 위조 소유권 주장 방지에 기여했다.
- EPH는 거의 모든 레이어에 분산 배치되어 통계적 분산 차이를 최소화하여 통계 분석에 대한 은밀성을 향상시켰다.
- 커널 컷오프/보완 및 정밀도 기반 변환 공격 후에도 원본 모델과 거의 동일한 정확도를 유지했으며, 성능 저하가 거의 없었다.
- 기능적으로 동일한 공격에 대해서도 강건성을 확보하여 내부 구조를 변경함에도 불구하고 모델 동작을 유지했다.
- SPH 비밀 키를 사용한 검증은 워터마킹된 모델을 정확히 식별하고, 무관한 모델나 수정된 모델를 거부함으로써 잘못된 경고 없이 작동했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.