Skip to main content
QUICK REVIEW

[논문 리뷰] Certified Neural Network Watermarks with Randomized Smoothing

Arpit Bansal, Ping-yeh Chiang|arXiv (Cornell University)|2022. 07. 16.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 랜덤화 스무딩을 사용하여 처음으로 검증 가능한 신경망 워터마킹 방법을 제안하며, 모델 파라미터가 인증된 ℓ₂ 임계값을 초월하지 않는 한 워터마킹의 지속성을 보장한다. 이 방법은 적대적 제거 공격에 대해 증명 가능한 강건성을 제공하며, 이전 방법들에 비해 뛰어난 경험적 내성도 입증한다.

ABSTRACT

Watermarking is a commonly used strategy to protect creators' rights to digital images, videos and audio. Recently, watermarking methods have been extended to deep learning models -- in principle, the watermark should be preserved when an adversary tries to copy the model. However, in practice, watermarks can often be removed by an intelligent adversary. Several papers have proposed watermarking methods that claim to be empirically resistant to different types of removal attacks, but these new techniques often fail in the face of new or better-tuned adversaries. In this paper, we propose a certifiable watermarking method. Using the randomized smoothing technique proposed in Chiang et al., we show that our watermark is guaranteed to be unremovable unless the model parameters are changed by more than a certain l2 threshold. In addition to being certifiable, our watermark is also empirically more robust compared to previous watermarking methods. Our experiments can be reproduced with code at https://github.com/arpitbansal297/Certified_Watermarks

연구 동기 및 목표

  • 비용이 많이 들고 가치 있는 딥 러닝 모델의 도용 및 무단 복제로부터의 증명 가능한 보호 수요 증가에 대응하기 위해.
  • 기존 워터마킹 방법의 한계를 극복하기 위해, 이는 고도로 발전한 적대적 제거 기법에 대해 경험적으로 취약하기 때문이다.
  • 이론적 인증과 공격에 대한 강력한 경험적 저항력을 동시에 제공하는 워터마킹 기법을 개발하기 위해.
  • ℓ₂ 기반의 위협 모델이 실제 워터마킹에 의미 있고 실용적인지 평가하기 위해.

제안 방법

  • 이 방법은 워터마킹의 강건성을 보장하기 위해 랜덤화 스무딩을 활용한다.
  • 워터마킹 탐지는 트리거 세트를 모델에 쿼리하여 수행되며, 여기서 워터마킹은 일관된 오분류를 유도하는 패턴으로 인코딩된다.
  • 인증은 원본 및 변형된 모델 파라미터 간의 ℓ₂ 거리에 기반하며, 이 임계값을 초월하는 모든 변경은 워터마킹을 파괴함을 보장한다.
  • 표준 학습과 랜덤화 스무딩 기반 강건성 목표를 모두 포함하는 수정된 손실 함수를 사용하여 워터마킹을 훈련한다.
  • 화이트박스 및_BLK박스 워터마킹 검증을 모두 지원하여, 실제 API 기반 배포 환경에서의 활용이 가능하다.
  • 표준 딥 러닝 프레임워크와 호환되며, 오픈소스 코드를 통해 재현 가능하도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1모델 파라미터가 특정 ℓ₂ 거리 이내로 변경되지 않는 한, 신경망 워터마킹이 제거되지 않도록 공식적으로 인증할 수 있는가?
  • RQ2실제로 인증 반경은 얼마나 의미가 있으며, 현실적인 적대적 공격에 대해 충분한 보호를 제공하는가?
  • RQ3제안된 검증 가능한 워터마킹 기법이 알려진 제거 공격에 대해 기존의 경험적 워터마킹 기법보다 뛰어난가?
  • RQ4API 접근만으로도 워터마킹을 검증할 수 있는가 (_BLK박스 설정), 아니면 화이트박스 접근이 필수적인가?
  • RQ5표준 벤치마크에서 워터마킹 강건성과 모델 정확도 사이의 상충 관계는 어떠한가?

주요 결과

  • 제안된 워터마킹은 증명 가능한 강건성을 확보한다: 모델 파라미터가 인증된 ℓ₂ 거리를 초월하지 않는 한 워터마킹이 그대로 유지된다.
  • CIFAR-10에서, 50 에포크의 피니팅 후에도 워터마킹이 유지되며, 기준선은 10 에포크 미만에 이미 완전히 제거된다.
  • 디스틸레이션 공격의 경우, 화이트박스 워터마킹은 50 에포크 후에도 트리거 세트 정확도 100%를 유지하며, 기준선보다 뚜렷하게 뛰어나다.
  • _BLK박스 설정에서, CIFAR-10에서 50 에포크의 디스틸레이션 후 워터마킹은 트리거 세트 정확도 81.25%를 기록했고, 기준선은 50.00%였다.
  • 인증이 필요하지 않은 경우에도, 다양한 데이터셋과 공격 유형에 걸쳐 일관된 경험적 우수성을 보였다.
  • 강건성 향상에도 불구하고, 약간의 정확도 손실이 발생한다: MNIST에서는 -0.1%, CIFAR-10에서는 -3.3%, CIFAR-100에서는 -1.1%이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.