[논문 리뷰] RIGA: Covert and Robust White-Box Watermarking of Deep Neural Networks
RIGA는 딥 뉴럴 네트워크를 위한 새로운 화이트박스 워터마킹 기법을 제안하며, 적대적 훈련을 통해 워터마크를 삽입함으로써 정확도 손실 없이도 은밀성과 내구성을 향상시킵니다. 이는 워터마크를 모델 가중치에 숨기기 위해 GAN 유사 프레임워크를 사용하고, 딥 뉴럴 네트워크 추출기로 구성되어 있으며, 미세조정, 프루닝, 모델 정규화와 같은 공격에 강력한 저항성을 보입니다.
Watermarking of deep neural networks (DNN) can enable their tracing once released by a data owner. In this paper, we generalize white-box watermarking algorithms for DNNs, where the data owner needs white-box access to the model to extract the watermark. White-box watermarking algorithms have the advantage that they do not impact the accuracy of the watermarked model. We propose Robust whIte-box GAn watermarking (RIGA), a novel white-box watermarking algorithm that uses adversarial training. Our extensive experiments demonstrate that the proposed watermarking algorithm not only does not impact accuracy, but also significantly improves the covertness and robustness over the current state-of-art.
연구 동기 및 목표
- 정확도 손실이 수용 불가능한 안전 중심 응용 분야에서 정확하고 추적 가능한 딥 러닝 모델의 필수적인 필요성을 해결합니다.
- 탐지 가능하거나 제거 공격에 취약한 기존 화이트박스 워터마킹 기법의 한계를 극복합니다.
- 비워터마크 모델의 가중치 분포와 유사하게 되도록 은밀한(코버티) 워터마킹을 설계하고, 일반적인 모델 변환 공격에 대한 내구성을 확보합니다.
- 기존 화이트박스 워터마킹을 향상시키기 위해 선형 추출기를 딥 뉴럴 네트워크로 대체하여 임bedding 용량과 내성 강도를 증가시킵니다.
제안 방법
- 워터마크가 삽입된 모델가 생성기 역할을 하고 워터마크 탐지기(디스criminator)가 디스criminator 역할을 하는 GAN 유사 적대적 훈련 프레임워크를 도입하여 모델 가중치에 워터마크를 숨깁니다.
- 워터마크 삽입 및 추출 과정을 적대적 손실을 기반으로 공동으로 훈련시켜, 워터마크가 삽입된 모델의 가중치 분포가 비워터마크 모델과 유사하게 유지되도록 보장합니다.
- 이전 연구에서 사용된 선형 워터마크 추출기를 딥 뉴럴 네트워크로 대체하여 워터마크 추출의 용량과 내구성을 향상시킵니다.
- 모델 정확도, 워터마크 은폐성, 추출기 성능를 균형 잡는 손실 함수를 최적화하여 훈련 중에 워터마크를 삽입합니다.
- 두 단계 훈련 프로세스를 적용합니다: 먼저 워터마크 제약 조건을 포함한 모델을 훈련하고, 이후 추출기 네트워크를 미세조정하여 임베딩된 메시지를 신뢰성 있게 복원합니다.
- 가중치 분포의 통계적 이탈을 최소화하기 위해 적대적 정규화를 적용하여 성질 추론 공격에 의한 탐지 가능성을 감소시킵니다.
실험 결과
연구 질문
- RQ1정확도 손실 없이도 은밀하고 내구적인 화이트박스 워터마킹 기법을 설계할 수 있는가?
- RQ2적대적 훈련 기법을 얼마나 효과적으로 활용하여 DNN 가중치에 워터마크를 숨기면서도 모델 성능을 유지할 수 있는가?
- RQ3선형 워터마크 추출기를 딥 뉴럴 네트워크로 대체할 경우 워터마킹 기법의 내구성과 용량에 어떤 영향을 미치는가?
- RQ4미세조정, 프루닝, 정규화와 같은 일반적인 모델 변환 공격에 대해 제안된 워터마킹 기법은 얼마나 내구성이 있는가?
- RQ5모델 압축이나 파rameter 수정이 상당히 이루어진 후에도 워터마크를 신뢰성 있게 추출할 수 있는가?
주요 결과
- RIGA는 모든 벤치마크(CIFAR-10, SVHN, ImageNet)에서 정확도 손실 없이 성능을 유지하며, 적대적 훈련과 워터마크 삽입 후에도 동일한 성능을 기록합니다.
- 비워터마크 모델의 가중치 분포와 유사하므로 성질 추론 공격에 의해 워터마크가 탐지되지 않습니다.
- 최대 99%의 가중치 프루닝에 대해 워터마크 BER(오류 비율)가 극히 낮게 유지(5% 이하)되며, 95% 프루닝 비율에서도 워터마크가 식별 가능합니다.
- 학습률 0.01에서 0.05 사이의 미세조정 공격는 모델 정확도를 심각하게 떨어뜨리며(예: 벤치마크 3에서 약 40%로 감소), 워터마크 제거에는 실패합니다.
- 딥 뉴럴 네트워크 기반의 워터마크 추출기가 모든 테스트 공격 및 모델 변형에 걸쳐 높은 정밀도로 임베딩된 메시지를 성공적으로 복원합니다.
- 다른 데이터셋을 사용한 전이 학습 환경에서도 워터마크 제거가 효과적이지 않으며, 이는 성능 저하가 심각해져서 적응 기반 공격에 강력한 저항성을 보입니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.