[논문 리뷰] PTW: Pivotal Tuning Watermarking for Pre-Trained Image Generators
PTW는 펄서널 튜닝을 활용해 사전 훈련된 이미지 생성자에 대해 데이터 없이 빠르게 워터마킹하는 방법을 도입하여, 한 시간 이내에 워터마킹을 통합할 수 있다. 이는 다시 훈련하는 것보다 세 배 정도 빠르며, 더 큰 모델과 더 긴 코드를 지원한다. 핵심적으로, 화이트박스 공격자가 극히 적은 데이터로 워터마킹을 제거할 수 있음을 보여주며, 딥페이크 탐지에 대한 워터마킹의 강건성에 도전한다.
Deepfakes refer to content synthesized using deep generators, which, when misused, have the potential to erode trust in digital media. Synthesizing high-quality deepfakes requires access to large and complex generators only a few entities can train and provide. The threat is malicious users that exploit access to the provided model and generate harmful deepfakes without risking detection. Watermarking makes deepfakes detectable by embedding an identifiable code into the generator that is later extractable from its generated images. We propose Pivotal Tuning Watermarking (PTW), a method for watermarking pre-trained generators (i) three orders of magnitude faster than watermarking from scratch and (ii) without the need for any training data. We improve existing watermarking methods and scale to generators $4 imes$ larger than related work. PTW can embed longer codes than existing methods while better preserving the generator's image quality. We propose rigorous, game-based definitions for robustness and undetectability, and our study reveals that watermarking is not robust against an adaptive white-box attacker who controls the generator's parameters. We propose an adaptive attack that can successfully remove any watermarking with access to only 200 non-watermarked images. Our work challenges the trustworthiness of watermarking for deepfake detection when the parameters of a generator are available. The source code to reproduce our experiments is available at https://github.com/nilslukas/gan-watermark.
연구 동기 및 목표
- 사전 훈련된 이미지 생성자에 대해 재훈련이 필요한 기존 워터마킹 방법의 비효율성과 확장성 한계를 해결하기 위해.
- 훈련 데이터에 접근할 수 없어도 대규모 생성자를 워터마킹할 수 있도록 하여 계산 비용과 시간을 줄이기 위해.
- 이미지 품질을 유지하면서 더 긴 코드를 통합함으로써 워터마킹의 용량-품질 트레이드오���을 향상시키기 위해.
- 게임 기반 보안 모델을 사용하여 워터마킹의 강건성(제거에 대한 저항성)과 탐지 불가능성(비밀 키 없이 통계적으로 구분 불가능성)을 철저히 정의하고 평가하기 위해.
- 공격자가 생성자의 파라미터를 제어할 수 있는 화이트박스 공격 환경에서 워터마킹의 취약성을 조사하기 위해.
제안 방법
- PTW는 모델의 파라미터 중 소수의 부분만 최적화하여 사전 훈련된 생성자에 효율적으로 워터마킹을 삽입하는 펄서널 튜닝을 활용한다. 이는 전체 미세조정을 피하는 방식이다.
- 이 방법은 비밀 키를 사용해 생성자의 특징 공간 내 특정 레이어를 조절하여, 이미지 합성 과정에서 잠재 공간에 이진 코드를 삽입한다.
- 워터마킹 추출은 비밀 키에 따라 작동하는 디코더를 사용하여 생성된 이미지를 분석해 내장된 코드를 복구한다.
- 이 접근법은 잠재 코드에서 이미지로 매핑하는 모든 생성자와 호환되며, StyleGAN 및 잠재 확산 모델을 포함한다.
- 비밀 키 없이 200장의 워터마킹되지 않은 이미지만으로도 생성자의 파라미터를 최적화해 워터마킹을 제거하는 적응형 공격인 역행 펄서널 튜닝(RPT)을 제안한다.
- 강건성(제거에 대한 저항성)과 탐지 불가능성(비밀 키 없이 통계적으로 구분 불가능성)을 공식적으로 모델링하기 위해 게임 기반 보안 정의를 도입한다.

실험 결과
연구 질문
- RQ1사전 훈련된 이미지 생성자에 대해 훈련 데이터가 전혀 필요 없이 워터마킹을 효율적으로 적용할 수 있는가?
- RQ2워터마킹 성능은 생성자 크기에 따라 어떻게 스케일링되며, 더 긴 내장 코드를 지원할 수 있는가?
- RQ3비밀 키 없이 생성자 파라미터에 완전히 접근 가능한 적응형 화이트박스 공격자에 대해 워터마킹이 강건한가?
- RQ4공격자가 워터마킹을 성공적으로 제거하기 위해 필요한 워터마킹되지 않은 이미지의 최소 수는 얼마인가?
- RQ5강력한 통계 분석 조건에서도 비밀 키 없이 악성 사용자가 워터마킹을 탐지할 수 없을 정도로 탐지 불가능한가?
주요 결과
- PTW는 워터마킹 삽입 시간을 한 GPU 월 이상에서 한 시간 이내로 단축시켜 이전 방법보다 세 배 정도의 속도 향상을 달성한다.
- 이 방법은 이전 연구에서 지원하는 것보다 네 배 더 큰 생성자에 더 긴 워터마킹을 삽입할 수 있으며, 이미지 품질에 거의 영향을 주지 않는다.
- 비밀 키 없이 워터마킹은 탐지 불가능하며, 최소 100장의 레이블이 부여된 워터마킹되지 않은 이미지와 워터마킹된 이미지가 있어야 공격자가 워터마킹 존재를 탐지할 수 있다.
- 적응형 화이트박스 공격자는 단지 200장의 워터마킹되지 않은 이미지만으로도 워터마킹을 제거할 수 있으며, 원래 훈련 데이터의 0.3% 미만으로도 가능하며, 이미지 품질에 거의 영향을 주지 않는다.
- 이 연구는 기존 워터마킹 기법이 생성자 파라미터가 노출된 화이트박스 위협 모델에서는 강건하지 않음을 드러내어, IP 보호를 위한 타당성을 훼손한다.
- 블랙박스 공격자에 대해 강력한 성능을 보이지만, 생성자가 화이트박스로 배포될 경우 오용을 막는 데 실패함으로써, 사전적 딥페이크 방지 전략으로서의 워터마킹의 역할에 의문을 제기한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.