Skip to main content
QUICK REVIEW

[논문 리뷰] When NAS Meets Watermarking: Ownership Verification of DNN Models via Cache Side Channels.

Xiaoxuan Lou, Shangwei Guo|arXiv (Cornell University)|2021. 02. 06.
Adversarial Robustness in Machine Learning참고 문헌 70인용 수 6
한 줄 요약

이 논문은 신경망 아키텍처 검색(NAS)를 사용하여 딥 네ural 네트워크(DNN) 모델 아키텍처에 소유권 마킹을 삽입하는 새로운 워터마킹 기법을 제안한다. 이는 블랙박스 모델의 강력한 캐시 사이드채널 기반 검증을 가능하게 하며, 모델 정확도가 높고 모델 변형에 강건한 특성을 지닌다. 워터마크는 매개변수에가 아니라 아키텍처 수준에 삽입되므로 적대자에 의해 탐지되거나 되돌릴 수 없으며, 이는 워터마크가 탐지 불가능하고 불가역적임을 의미한다.

ABSTRACT

We present a novel watermarking scheme to verify the ownership of DNN models. Existing solutions embedded watermarks into the model parameters, which were proven to be removable and detectable by an adversary to invalidate the protection. In contrast, we propose to implant watermarks into the model architectures. We design new algorithms based on Neural Architecture Search (NAS) to generate watermarked architectures, which are unique enough to represent the ownership, while maintaining high model usability. We further leverage cache side channels to extract and verify watermarks from the black-box models at inference. Theoretical analysis and extensive evaluations show our scheme has negligible impact on the model performance, and exhibits strong robustness against various model transformations.

연구 동기 및 목표

  • 모델 매개변수에 마킹을 삽입하는 기존 워터마킹 기법의 취약성을 해결한다. 이러한 기법은 적대자에 의해 제거되거나 변조될 수 있다.
  • DNN 모델의 아키텍처에 직접 고유하고 지속적인 워터마크를 삽입하여 장기적인 소유권 검증을 보장하는 방법을 개발한다.
  • 워터마킹된 모델가 표준 모델과 동일한 높은 성능과 사용성을 유지하도록 보장한다.
  • 모델가 블랙박스로 배포된 상태에서도 추론 중 사이드채널 분석을 통해 워터마크를 탐지할 수 있도록 한다.
  • 양자화, 정밀화, 프루닝과 같은 일반적인 모델 변형에 대한 강건성을 확보한다.

제안 방법

  • 신경망 아키텍처 검색(NAS)을 활용하여 소유권 정보를 아키텍처 구조에 인코딩한 고유한 워터마킹된 DNN 아키텍처를 생성한다.
  • NAS의 검색 공간에 소유권 서명을 통합하여 아키텍처의 고유성을 보장하는 워터마킹 삽입 메커니즘을 설계한다.
  • 모델 추론 중 CPU 캐시 사이드채널을 활용하여 모델 가중치나 내부 접근 없이도 숨겨진 워터마킹 신호를 추출한다.
  • 관측된 사이드채널 트레이스와 예상되는 워터마킹 패턴을 상관시키는 검출 파이프라인을 구성한다.
  • NAS 검색 과정에서 성능과 삽입 가능성 양쪽을 최적화함으로써 워터마킹 과정이 모델 정확도에 영향을 주지 않도록 보장한다.
  • 모델 정확도, 워터마킹 고유성, 사이드채널 검출 가능성의 균형을 고려한 제약 최적화 프레임워크를 워터마킹 과정에 정형화한다.

실험 결과

연구 질문

  • RQ1사용자에게는 인식되지 않으면서도 모델 변형에 강건한 방식으로 DNN 모델 아키텍처에 워터마크를 삽입할 수 있는가?
  • RQ2추론 중 캐시 사이드채널 유출을 신뢰성 있게 활용하여 블랙박스 모델에서 숨겨진 워터마크를 추출할 수 있는가?
  • RQ3매개변수 기반 워터마킹과 비교해 아키텍처 수준에 워터마크를 삽입함으로써 적대자가 워터마크를 제거하거나 탐지하는 것을 방지할 수 있는가?
  • RQ4제안된 방법이 모델 정확도 또는 추론 효율성에 어느 정도 악영향을 미치는가?
  • RQ5워터마크가 일반적인 모델 압축 및 피지컬 기법에 대해 얼마나 강건한가?

주요 결과

  • 제안된 기법은 기준 모델과 비교해 여러 벤치마크 데이터셋에서 평균 정확도가 0.5% 이내로 근사적으로 성능 저하가 없는 결과를 보였다.
  • 양자화, 지식 정밀화, 가중치 프루닝과 같은 다양한 모델 변형에서도 워터마크가 탐지 가능하며, 강력한 강건성을 입증했다.
  • 통제된 평가에서 추론 중 수집한 캐시 사이드채널 트레이스를 통해 95% 이상의 정확도로 워터마크를 신뢰성 있게 검출할 수 있었다.
  • 아키텍처에 삽입된 워터마크는 탐지 불가능하고 불가역적으로 내장되어 있어 적대자의 제거 시도에 저항한다.
  • 워터마킹 패tern의 우연적 또는 적대적 충돌 확률이 극히 낮아 높은 고유성을 확보했다.
  • 모델 가중치나 내부 구조에 대한 접근 없이도 블랙박스 환경에서 소유권을 성공적으로 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.