[论文解读] The Stable Signature: Rooting Watermarks in Latent Diffusion Models
本文提出 Stable Signature,一种通过仅微调潜在扩散模型(LDM)的潜在解码器并嵌入二进制签名,直接将不可见水印嵌入模型的方法。该方法可在裁剪、缩放或编辑后仍实现鲁棒、高效且安全的 AI 生成图像检测,检测准确率超过 90%,误报率低于 10⁻⁶。
Generative image modeling enables a wide range of applications but raises ethical concerns about responsible deployment. This paper introduces an active strategy combining image watermarking and Latent Diffusion Models. The goal is for all generated images to conceal an invisible watermark allowing for future detection and/or identification. The method quickly fine-tunes the latent decoder of the image generator, conditioned on a binary signature. A pre-trained watermark extractor recovers the hidden signature from any generated image and a statistical test then determines whether it comes from the generative model. We evaluate the invisibility and robustness of the watermarks on a variety of generation tasks, showing that Stable Signature works even after the images are modified. For instance, it detects the origin of an image generated from a text prompt, then cropped to keep $10\%$ of the content, with $90$+$\%$ accuracy at a false positive rate below 10$^{-6}$.
研究动机与目标
- 为解决合成图像真实性相关的伦理问题,实现对 AI 生成图像的可靠检测。
- 克服事后水印技术的局限性,即若模型开源则水印可能被轻易移除。
- 在不改变架构或导致性能下降的前提下,将水印原生集成到生成过程中。
- 确保水印在真实世界图像操作(如裁剪、缩放和编辑)下依然具备鲁棒性。
- 为模型提供方和内容平台提供一种安全、高效且兼容的解决方案,以追踪和监控 AI 生成内容。
提出的方法
- 通过感知损失与水印提取器生成的隐藏信息损失相结合,仅微调预训练 LDM 的潜在解码器。
- 使用基于简化 HiDDeN 方法的预训练水印提取器,从生成图像中恢复嵌入的二进制签名。
- 对水印提取器的输出进行白化处理,使比特分布更接近独立同分布的伯努利分布,提升统计可靠性。
- 在真实图像子集上训练水印提取器,确保当图像未被水印化时,提取的消息在统计上与随机无异。
- 基于提取消息与预期消息之间的汉明距离,使用带阈值的统计检验判断生成图像是否包含水印。
- 通过反向传播进行端到端训练,在生成过程中嵌入签名,同时保持图像质量和 FID 分数不变。

实验结果
研究问题
- RQ1是否可以在不修改架构或扩散过程的前提下,将水印无缝集成到潜在扩散模型的生成过程中?
- RQ2水印对裁剪、缩放和修复等常见图像操作的鲁棒性如何?
- RQ3是否能在保持极低误报率的同时实现高精度检测?
- RQ4水印过程是否会降低生成图像的感知质量或 FID 分数?
- RQ5与事后水印技术相比,该方法在安全性和效率方面表现如何?
主要发现
- 在图像仅保留原始大小 10% 的裁剪情况下,检测准确率仍超过 90%,误报率低于 10⁻⁶。
- 即使在复杂的编辑操作(如图像修复和超分辨率)后,水印依然保持鲁棒性,在具有挑战性的场景中比特准确率显著高于随机猜测。
- 水印嵌入后,生成图像的 FID 分数保持不变,证实图像质量未受任何降级影响。
- 水印提取器在理论与实际误报率之间实现近乎完美的匹配,验证了统计模型的准确性。
- 该方法计算效率高,且与多种基于 LDM 的应用完全兼容,包括文生图、图像修复和图像编辑。
- 在安全性方面优于事后水印技术,即使模型开源,水印也无法在不重新训练模型的情况下被移除。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。