Skip to main content
QUICK REVIEW

[论文解读] DUAW: Data-free Universal Adversarial Watermark against Stable Diffusion Customization

Xiaoyu Ye, Hao Huang|arXiv (Cornell University)|Aug 19, 2023
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文提出DUAW,一种无需数据的通用对抗性水印,通过在微调过程中扰动变分自编码器(VAE),破坏Stable Diffusion模型的定制化能力,从而在生成图像中引入严重的视觉失真。DUAW在大型语言模型和预训练SD模型生成的合成图像上进行训练,可对多种SD版本和定制方法实现隐蔽的版权图像保护,使用简单分类器实现96.43%的准确率,有效识别侵权输出。

ABSTRACT

Stable Diffusion (SD) customization approaches enable users to personalize SD model outputs, greatly enhancing the flexibility and diversity of AI art. However, they also allow individuals to plagiarize specific styles or subjects from copyrighted images, which raises significant concerns about potential copyright infringement. To address this issue, we propose an invisible data-free universal adversarial watermark (DUAW), aiming to protect a myriad of copyrighted images from different customization approaches across various versions of SD models. First, DUAW is designed to disrupt the variational autoencoder during SD customization. Second, DUAW operates in a data-free context, where it is trained on synthetic images produced by a Large Language Model (LLM) and a pretrained SD model. This approach circumvents the necessity of directly handling copyrighted images, thereby preserving their confidentiality. Once crafted, DUAW can be imperceptibly integrated into massive copyrighted images, serving as a protective measure by inducing significant distortions in the images generated by customized SD models. Experimental results demonstrate that DUAW can effectively distort the outputs of fine-tuned SD models, rendering them discernible to both human observers and a simple classifier.

研究动机与目标

  • 为应对Stable Diffusion定制化带来的版权侵权风险,即用户可复制受版权保护图像中的主体或风格。
  • 开发一种通用的、不可见的水印,可在不访问原始图像的情况下保护各类受版权保护的图像。
  • 在不修改模型权重的前提下,确保对多个Stable Diffusion版本和定制技术(如DreamBooth、LoRA)具有鲁棒保护能力。
  • 在保持水印不可见的同时,最大化微调模型输出中的失真程度,即使在图像预处理攻击下也保持有效性。
  • 通过大型语言模型和预训练SD模型生成合成训练数据,实现无需数据的训练,从而保护受保护图像的机密性。

提出的方法

  • DUAW采用基于优化器的对抗性攻击进行训练,旨在最小化应用水印后原始图像与VAE重建图像之间的相似度。
  • 水印被优化以干扰VAE的编码与解码过程,该过程在SD微调期间保持冻结,从而确保生成输出中的一致性失真。
  • 通过大型语言模型(如ChatGPT)和预训练的Stable Diffusion v2.1模型生成合成训练图像,实现无需访问真实受版权保护图像的无数据训练。
  • 该方法专门针对VAE组件,利用观察结果:训练图像中的微小扰动会在微调模型输出中被保留并放大。
  • 水印在多种图像上通用应用,并在不同VAE变体(base、ft-ema、ft-mse)和SD模型版本间测试其可迁移性。
  • 在常见图像损坏(高斯模糊、JPEG压缩、随机噪声)下评估鲁棒性,保护成功率作为关键指标报告。

实验结果

研究问题

  • RQ1能否构建一种通用对抗性水印,在不访问真实受版权保护图像的情况下,有效扭曲微调后Stable Diffusion模型的输出?
  • RQ2在Stable Diffusion定制化过程中干扰VAE是否能有效降低不同定制方法(如DreamBooth、LoRA)生成图像的质量?
  • RQ3使用LLM生成的合成图像进行无数据训练方法,能否在保护图像机密性的前提下实现有效的水印保护?
  • RQ4该水印在常见图像预处理攻击(如JPEG压缩和高斯模糊)下是否具备鲁棒性?
  • RQ5该水印在不同VAE变体和未来Stable Diffusion模型版本之间具有多大程度的泛化能力?

主要发现

  • 使用简单ViT分类器,DUAW在识别侵权图像方面达到96.43%的成功率,证明其在检测模型生成失真方面具有极高有效性。
  • 水印在生成图像中引发显著的视觉退化,人类观察者在多种提示词和定制方法下均能清晰察觉失真。
  • DUAW在不同VAE变体间表现出极强的可迁移性:在ft-mse上训练时,其在base VAE上实现99.05%的保护成功率,在ft-ema上达到99.90%,表明具有广泛的兼容性。
  • 水印在常见图像损坏下仍保持鲁棒性——高斯模糊和JPEG压缩会轻微降低失真程度,但未损害整体保护有效性。
  • 在epsilon值为0.05时,DUAW保持高不可见性(SSIM ≈ 0.98),同时仍能有效引发失真,实现了隐蔽性与保护效果的平衡。
  • 该方法在多个SD模型版本(包括SD v2.1和SD XL 1.0)中表现一致,具有稳定性能,表明其在未来的模型保护中具有潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。