[论文解读] Warfare:Breaking the Watermark Protection of AI-Generated Content
本文提出 Warfare,一种统一的对抗性攻击框架,通过使用预训练扩散模型和生成对抗网络(GAN),高效地从AI生成内容中移除或伪造水印。该方法在水印移除与伪造任务中均取得极高成功率,速度比以往方法快达11,000倍,同时保持图像质量,暴露出当前AIGC水印方案中的关键安全漏洞。
AI-Generated Content (AIGC) is rapidly expanding, with services using advanced generative models to create realistic images and fluent text. Regulating such content is crucial to prevent policy violations, such as unauthorized commercialization or unsafe content distribution. Watermarking is a promising solution for content attribution and verification, but we demonstrate its vulnerability to two key attacks: (1) Watermark removal, where adversaries erase embedded marks to evade regulation, and (2) Watermark forging, where they generate illicit content with forged watermarks, leading to misattribution. We propose Warfare, a unified attack framework leveraging a pre-trained diffusion model for content processing and a generative adversarial network for watermark manipulation. Evaluations across datasets and embedding setups show that Warfare achieves high success rates while preserving content quality. We further introduce Warfare-Plus, which enhances efficiency without compromising effectiveness. The code can be found in https://github.com/GuanlinLee/warfare.
研究动机与目标
- 探究现有AI生成内容(AIGC)水印方案在对抗性攻击下的脆弱性。
- 开发一种实用、高效且统一的攻击框架,可在无需干净数据或水印机制先验知识的情况下,同时实现水印移除与伪造。
- 在多种数据集、水印方法及图像复杂度(包括高分辨率与复杂场景)下评估所提攻击的有效性。
- 证明在现实攻击场景中,当前水印防御机制在攻击者仅能访问水印输出的情况下已显不足。
提出的方法
- 攻击者仅从目标服务或用户处收集水印化的AIGC输出,无需干净的参考图像。
- 使用预训练扩散模型(如DDPM)对水印内容进行去噪,通过反转噪声注入过程,有效擦除嵌入的水印信号。
- 训练生成对抗网络(GAN),使其将水印图像的分布映射至去噪后的(水印已擦除)图像分布,以实现水印移除;或映射至目标水印嵌入的分布,以实现水印伪造。
- GAN生成器采用少样本方式训练,仅使用少量水印样本,即可实现对未见水印的泛化能力。
- 该框架利用扩散模型的语义一致性,在水印操作过程中保留图像细节,维持高感知质量。
- 该方法在多种水印方案(包括事后与事前方法)上进行评估,并在CelebA、FFHQ和LSUN等多样化数据集上进行测试。

实验结果
研究问题
- RQ1攻击者能否在无干净数据或水印密钥的情况下,从AI生成内容中移除水印?
- RQ2攻击者能否将另一用户水印伪造到非法或不安全内容上,导致错误归属?
- RQ3与现有水印破解方法相比,所提攻击在速度与成功率方面效率如何?
- RQ4在水印移除或伪造过程中,攻击是否能保持高图像质量与语义一致性?
- RQ5该攻击是否能泛化至未见过的水印及复杂、高分辨率图像?
主要发现
- Warfare在多个数据集与水印方案(包括事后与事前方法)上,均实现超过95%的成功率,完成水印移除与伪造。
- 与现有基于扩散模型的水印移除方法相比,该攻击速度快5,050至11,000倍,显著提升效率。
- Warfare保持了高图像质量,FID分数下降极小,CLIP与SSIM指标保持稳定,即使在LSUN的复杂高分辨率图像上攻击也表现优异。
- 该框架在移除与伪造场景下均成功绕过水印验证,证明其在真实环境中的实际可行性。
- 仅通过少量样本微调,该方法即可良好泛化至未见水印,表明其对新目标的强大适应能力。
- 可视化结果表明,Warfare保留了语义细节,并生成与真实水印模型相似的残差模式,表明其有效学习了水印嵌入模式。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。