Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Structure Consistency for Deep Model Watermarking

Jie Zhang, Dongdong Chen|arXiv (Cornell University)|2021. 08. 05.
Adversarial Robustness in Machine Learning참고 문헌 32인용 수 4
한 줄 요약

이 논문은 엣지나 의미적 영역(예: 눈)과 같은 물리적으로 일관된 이미지 구조에 워터마크를 통합함으로써 데이터 증강 공격에 대한 강건성을 향상시키는 '구조 일관성' 기반의 새로운 딥 림워크 워터마킹 방법을 제안한다. 기존의 전체 이미지 일관성에 의존하는 방법과 달리, 이 방법은 이동, 자르기, 크기 조정 등의 변환에서도 워터마크의 무결성을 유지하여, 비소음 제거 및 포트레이트 생성과 같은 이미지 처리 작업에서 공격적인 증강 조건에서도 90% 이상의 추출 정확도를 달성한다.

ABSTRACT

The intellectual property (IP) of Deep neural networks (DNNs) can be easily ``stolen'' by surrogate model attack. There has been significant progress in solutions to protect the IP of DNN models in classification tasks. However, little attention has been devoted to the protection of DNNs in image processing tasks. By utilizing consistent invisible spatial watermarks, one recent work first considered model watermarking for deep image processing networks and demonstrated its efficacy in many downstream tasks. Nevertheless, it highly depends on the hypothesis that the embedded watermarks in the network outputs are consistent. When the attacker uses some common data augmentation attacks (e.g., rotate, crop, and resize) during surrogate model training, it will totally fail because the underlying watermark consistency is destroyed. To mitigate this issue, we propose a new watermarking methodology, namely ``structure consistency'', based on which a new deep structure-aligned model watermarking algorithm is designed. Specifically, the embedded watermarks are designed to be aligned with physically consistent image structures, such as edges or semantic regions. Experiments demonstrate that our method is much more robust than the baseline method in resisting data augmentation attacks for model IP protection. Besides that, we further test the generalization ability and robustness of our method to a broader range of circumvention attacks.

연구 동기 및 목표

  • 데이터 증강 공격에 노출되었을 때 기존 워터마킹 기법이 딥 이미지 처리 모델에서 취약한 점을 해결하기 위해.
  • 자르기나 회전과 같은 일반적인 증강 조건에서 전체 이미지 일관성 기반 워터마킹의 실패 원인을 규명하기 위해.
  • 엣지나 의미적 영역과 같은 물리적으로 의미 있는 이미지 구조에 워터마크를 정렬함으로써 워터마크 일관성을 유지하는 새로운 워터마킹 방법론을 개발하기 위해.
  • 시각적 품질과 다양한 이미지 처리 작업에서의 강건성을 유지하는 구조 정렬 워터마킹 프레임워크를 설계하기 위해.

제안 방법

  • 엣지나 의미적 영역(예: 눈)과 같은 물리적으로 안정된 이미지 구조에 워터마크를 인코딩하는 새로운 워터마킹 방법론인 '구조 일관성'을 제안한다.
  • 워터마크 비트 인코더, 임bedding 네트워크, 추출 네트워크, 디코더로 구성된 사모듈 프레임워크를 설계하였으며, 모든 모듈을 엔드 투 엔드로 훈련시켜 워터마크의 무결성을 유지한다.
  • Canny나 의미적 세그멘테이션을 통해 검출된 구조에 일정한 색상 값(예: 고정 색상)을 통합하여 기하학적 변환에 대해 일관성을 유지하는 구조 정렬 워터마크를 생성한다.
  • 증강 연산자와 손실 제약 조건을 점진적으로 도입하는 인크리멘탈 훈련 전략을 활용하여 훈련 중 강건성을 향상시킨다.
  • 추출 네트워크를 활용해 워터마크가 포함된 이미지에서만 워터마크를 감지하고 복구함으로써, 정제된 입력에 대해 잘못된 경고(false positive)가 발생하지 않도록 보장한다.
  • 비소음 제거, 예술적 포트레이트 생성, X-ray 뼈 제거 등 다양한 작업에 프레임워크를 적용하여, 다양한 물리적 구조와 응용 분야에 걸쳐 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1왜 전체 이미지 일관성 기반 워터마킹 방법은 랜덤 자르기나 회전과 같은 일반적인 데이터 증강 공격에 실패하는가?
  • RQ2워터마크가 고정된 이미지 위치가 아닌 엣지나 의미적 영역과 같은 물리적으로 안정된 구조에 정렬될 경우, 워터마크 일관성이 유지될 수 있는가?
  • RQ3구조 일관성이 증강된 훈련 데이터를 사용하는 서로 모델 공격에 대해 어떻게 강건성을 향상시키는가?
  • RQ4제안된 방법이 다양한 이미지 처리 작업과 물리적 구조 유형(예: 전역 엣지 대비 국소 의미적 영역) 간에 얼마나 일반화 가능한가?
  • RQ5Neural Cleanse, 미세 조정, 도메인 적대적 훈련과 같은 고급 방지 기법에 대해 구조 일관성 워터마크 기반 기법은 얼마나 내구성이 있는가?

주요 결과

  • 제안된 구조 일관성 워터마킹 기법은 공격적인 데이터 증강 조건에서도 90% 이상의 워터마크 추출 정확도를 달성하며, 기존의 전체 이미지 일관성 기반 기법은 이러한 공격 조건에서 완전히 실패함을 입증했다.
  • 서로 모델 훈련 데이터의 50%가 자체 레이블이 부여된 정제된 데이터일 경우에도 이 기법은 높은 강건성을 유지하며, 워터마크 추출 성공률가 78%로 유지되며 일관성 제약 조건이 파괴된 상황에서도 유의미하게 작동한다.
  • Neural Cleanse는 워터마크를 탐지하지 못한다. 공격의 가정에 따르면 트리거는 입력에 독립적이고 고정된 위치와 패턴여야 하는데, 본 연구의 워터마크는 전역적이고 구조 정렬된 특성을 지니므로 이러한 조건을 충족하지 못한다.
  • 소량의 정제된 데이터로 미세 조정을 수행하면 워터마크 추출 성공률는 78%로 감소하지만, 동시에 서로 모델의 성능은 심각하게 저하되며(PSNR가 32.3에서 28.9로 감소), 공격의 실용성이 크게 떨어진다.
  • 이 프레임워크는 다양한 작업에 대해 잘 일반화된다: 비소음 제거 및 예술적 포트레이트 생성 모두에서 워터마크를 성공적으로 추출하였으며, 시각적 결과는 최소한의 인지적 왜곡을 보였다.
  • 워터마크 오버라이팅 이후에도 원본 워터마크를 여전히 추출할 수 있으며, 서로 모델의 성능은 심각하게 저하되어, 공격 후 조작에 대한 강력한 내구성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.