Skip to main content
QUICK REVIEW

[논문 리뷰] Warfare:Breaking the Watermark Protection of AI-Generated Content

Guanlin Li, Yifei Chen|arXiv (Cornell University)|2023. 09. 27.
Adversarial Robustness in Machine LearningComputer Science인용 수 3
한 줄 요약

이 논문은 사전 훈련된 확산 모델과 생성적 적대적 네트워크(GAN)를 사용하여 AI 생성 콘텐츠에서 워터마크를 효율적으로 제거하거나 위조하는 통합된 적대적 공격 프레임워크인 Warfare를 소개한다. 이는 기존 방법보다 최대 11,000배 빠른 속도로 워터마크 제거 및 위조를 달성하면서도 이미지 품질을 유지하며, AIGC를 위한 기존 워터마킹 기법에 심각한 취약점을暴露한다.

ABSTRACT

AI-Generated Content (AIGC) is rapidly expanding, with services using advanced generative models to create realistic images and fluent text. Regulating such content is crucial to prevent policy violations, such as unauthorized commercialization or unsafe content distribution. Watermarking is a promising solution for content attribution and verification, but we demonstrate its vulnerability to two key attacks: (1) Watermark removal, where adversaries erase embedded marks to evade regulation, and (2) Watermark forging, where they generate illicit content with forged watermarks, leading to misattribution. We propose Warfare, a unified attack framework leveraging a pre-trained diffusion model for content processing and a generative adversarial network for watermark manipulation. Evaluations across datasets and embedding setups show that Warfare achieves high success rates while preserving content quality. We further introduce Warfare-Plus, which enhances efficiency without compromising effectiveness. The code can be found in https://github.com/GuanlinLee/warfare.

연구 동기 및 목표

  • 기존 AI 생성 콘텐츠(AIGC) 워터마킹 기법이 적대적 공격에 얼마나 취약한지 조사하기 위해.
  • 청정 데이터나 워터마킹 메커니즘에 대한 사전 지식 없이도 워터마크 제거 및 위조가 가능한 실용적이고 효율적이며 통합된 공격 프레임워크를 개발하기 위해.
  • 다양한 데이터셋, 워터마킹 방법, 이미지 복잡도(고해상도 및 복잡한 장면 포함)에 걸쳐 제안된 공격의 효과성을 평가하기 위해.
  • 실제 공격 환경에서 악성 사용자가 청정 출력만을 접근 가능할 경우 기존 워터마킹 방어가 부적절하다는 것을 입증하기 위해.

제안 방법

  • 공격자는 청정 기준 이미지가 필요 없이, 대상 서비스나 사용자로부터 단지 워터마크가 삽입된 AIGC 출력물만 수집한다.
  • 사전 훈련된 확산 모델(예: DDPM)을 사용하여 워터마크가 삽입된 콘텐츠의 노이즈를 제거함으로써, 노이즈 주입 과정을 역행함으로써 내장된 워터마크 신호를 효과적으로 삭제한다.
  • 생성적 적대적 네트워크(GAN)를 사용하여 워터마크가 삽입된 이미지의 분포를 워터마크가 제거된(워터마크가 지워진) 이미지의 분포로 매핑하거나, 목표 워터마크가 삽입된 분포로 매핑함으로써 워터마크 제거 또는 위조를 수행한다.
  • 소수의 워터마크가 삽입된 샘플만을 사용하여 GAN 생성기를 소수 샘플 훈련 방식으로 훈련함으로써, 미리 보지 않은 워터마크로의 일반화를 가능하게 한다.
  • 확산 모델의 의미 일관성을 활용하여 워터마크 조작 중에도 이미지의 세부 사항을 유지함으로써 높은 정성 품질을 유도한다.
  • 이 방법은 CelebA, FFHQ, LSUN 등의 다양한 데이터셋에서 후행 및 사전 기법 워터마킹 기법을 포함한 여러 워터마킹 기법에 대해 평가된다.
Figure 1 : Overview of Warfare . (1) Collecting watermarked data from the target AIGC service or Internet. (2) Using a public pre-trained denoising model to purify the watermarked data. (3) Adopting the watermarked and mediator data to train a GAN, which can be used to remove or forge the watermark.
Figure 1 : Overview of Warfare . (1) Collecting watermarked data from the target AIGC service or Internet. (2) Using a public pre-trained denoising model to purify the watermarked data. (3) Adopting the watermarked and mediator data to train a GAN, which can be used to remove or forge the watermark.

실험 결과

연구 질문

  • RQ1청정 데이터나 워터마킹 키에 접근할 수 없는 공격자가 AI 생성 콘텐츠의 워터마크를 제거할 수 있는가?
  • RQ2다른 사용자의 워터마크를 불법적이거나 위험한 콘텐츠에 위조하여 잘못된 귀속을 유도할 수 있는가?
  • RQ3기존 워터마킹 해제 방법에 비해 제안된 공격의 속도와 성공률 측면에서 얼마나 효율적이고 효과적인가?
  • RQ4워터마크 제거 또는 위조 과정 중에 높은 이미지 품질과 의미 일관성이 유지되는가?
  • RQ5미리 보지 않은 워터마크와 복잡한 고해상도 이미지로도 공격가능성이 있는가?

주요 결과

  • Warfare는 후행 및 사전 기법 워터마킹을 포함한 다양한 데이터셋과 워터마킹 기법에서 성공률가 95% 이상을 달성한다.
  • 기존 확산 기반 워터마크 제거 방법 대비 5,050~11,000배 빠른 속도를 기록하여 효율성 면에서 크게 향상되었다.
  • FID 점수의 최소 감소와 CLIP, SSIM 지표의 유지로 인해 고해상도 및 복잡한 이미지(예: LSUN)에 공격하더라도 높은 이미지 품질을 유지한다.
  • 공격은 워터마크 검증을 제거 및 위조 시나리오 양쪽 모두에서 성공적으로 우회하여 실세계 환경에서의 실용성을 입증한다.
  • 소수 샘플 미세조정만으로도 새로운 타겟에 대해 강력한 일반화 능력을 보이며, 새로운 워터마크에 대한 적응 능력이 뛰어나다.
  • 시각화 결과는 Warfare가 의미적 세부 정보를 유지하고 진정성 있는 워터마킹 모델과 유사한 잔여 패턴을 생성함으로써, 내장 패턴을 효과적으로 학습했다는 것을 확인한다.
(a) Watermark Removal
(a) Watermark Removal

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.