[논문 리뷰] Have You Stolen My Model? Evasion Attacks Against Deep Neural Network Watermarking Techniques
이 논문은 DNN 워터마킹에 대한 두 가지 회피 공격을 제시한다: 앙상블 모델 공격과 탐지기 기반 공격으로, 두 경우 모두 워터마크 소유자의 소유 확인을 실패하게 만든다.
Deep neural networks have had enormous impact on various domains of computer science, considerably outperforming previous state of the art machine learning techniques. To achieve this performance, neural networks need large quantities of data and huge computational resources, which heavily increases their construction costs. The increased cost of building a good deep neural network model gives rise to a need for protecting this investment from potential copyright infringements. Legitimate owners of a machine learning model want to be able to reliably track and detect a malicious adversary that tries to steal the intellectual property related to the model. Recently, this problem was tackled by introducing in deep neural networks the concept of watermarking, which allows a legitimate owner to embed some secret information(watermark) in a given model. The watermark allows the legitimate owner to detect copyright infringements of his model. This paper focuses on verifying the robustness and reliability of state-of- the-art deep neural network watermarking schemes. We show that, a malicious adversary, even in scenarios where the watermark is difficult to remove, can still evade the verification by the legitimate owners, thus avoiding the detection of model theft.
연구 동기 및 목표
- MLaaS 및 독점적 환경에서 저작권 침해로부터 ML 모델을 보호할 필요성을 고무하고 형식화한다.
- 적대자에 대한 강건성을 위한 백도어 기반의 최첨단 DNN 워터마킹 기법을 검토하고 실험한다.
- 서비스 품질을 유지하면서 워터마크 검증을 방해할 수 있는 실용적 회피 전략을 시연한다.
제안 방법
- 다양한 공급자로부터 다수의 고품질 모델을 훔쳐 API 계층 뒤에서 다수결 앙상블로 융합하여 워터마크 검증을 회피하는 앙상블 공격을 제안한다.
- 보지 못한 워터마크 트리거가 무작위 입력처럼 작동해 다수결 하에서 올바른 워터마크 검증의 가능성을 감소시킴을 보인다.
- 워터마크 트리거가 모델 간에 교차하지 않는 앙상블 설정을 제시하고 앙상블 크기가 달라질 때 검증 성공을 평가한다.
- 탐지기 공격을 제안한다: 훔친 모델의 특징을 사용해 이진 분류기(Detector)를 학습하여 워터마크 트리거를 탐지하고 의심되는 트리거에 대해 무작위 예측을 반환한다.
- 사전 학습된 네트워크(ResNet50, InceptionV3, Xception, VGG16, VGG19)를 사용해 탐지기 성능을 평가하고 탐지 정확도를 90% 이상으로 달성한다.
- MNIST 규모의 실험으로 접근법을 시연하고 ImageNet 같은 대규모 작업에의 적용 가능성을 논의한다.
실험 결과
연구 질문
- RQ1다른 모델들로 구성된 앙상블에 의해 모델이 훔쳐져 서비스될 때 워터마크 검증을 신뢰성 있게 수행할 수 있는가?
- RQ2타깃이 된 워터마크 트리거의 존재를 앙상블 투표나 탐지 메커니즘을 통해 정상 작업 정확도를 희생하지 않으면서 모호하게 만들 수 있는가?
- RQ3MLaaS 환경에서 이러한 회피 전략을 구현하는 적대자의 실용성 및 비용은 어느 정도인가?
- RQ4블랙박스 접근에서 현재 백도어 기반 워터마크의 회피에 대한 강건성은 어느 정도인가?
주요 결과
- 앙상블 공격은 워터마크 검증 성공을 크게 낮춘다; 일곱 모델 앙상블의 경우 MNIST에서 검증 가능한 워터마크 소유권은 약 25.5%로 떨어지고, 더 큰 작업이나 더 작은 앙상블의 경우 약 15–34% 정도이다.
- 작은 앙상블(3개 모델)도 여전히 상당한 회피를 가능하게 하며, 테스트 설정에서 MNIST의 검증된 워터마크 부분은 약 34%이다.
- 탐지기 공격은 훔친 모델에 따라 약 91–95%의 높은 탐지 정확도를 가능하게 하여 워터마크 트리거를 판단하고 무작위 예측을 출력하며, 검증 성공률을 트리거당 1/l로 감소시킨다(여기서 l은 출력 공간의 크기).
- 워터마크 검증은 적대자가 훔친 모델로 뒷받침되는 MLaaS를 배포하면 합법적 소유자에 대한 워터마크 검증은 여전히 신뢰할 수 없으며, 앙상블의 이점으로 깨끗한 입력에 대한 서비스 품질은 유지되거나 향상된다.
- 실험은 블랙박스 접근 하에서 두 공격의 실현 가능성을 보여주며, Adi 등이 제안한 백도어 워터마크 체계와 같은 실용적 위험을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.