Skip to main content
QUICK REVIEW

[论文解读] Exploring Structure Consistency for Deep Model Watermarking

Jie Zhang, Dongdong Chen|arXiv (Cornell University)|Aug 5, 2021
Adversarial Robustness in Machine Learning参考文献 32被引用 4
一句话总结

本文提出一种基于“结构一致性”的新型深度模型水印方法,将水印嵌入边缘或语义区域(如眼睛)等物理上一致的图像结构中,以增强对数据增强攻击的鲁棒性。与依赖整图一致性的先前方法不同,该方法在旋转、裁剪和缩放下仍能保持水印完整性,在图像处理任务(如去雨和人像生成)中表现出色,即使在强烈增强攻击下,水印提取准确率仍超过90%。

ABSTRACT

The intellectual property (IP) of Deep neural networks (DNNs) can be easily ``stolen'' by surrogate model attack. There has been significant progress in solutions to protect the IP of DNN models in classification tasks. However, little attention has been devoted to the protection of DNNs in image processing tasks. By utilizing consistent invisible spatial watermarks, one recent work first considered model watermarking for deep image processing networks and demonstrated its efficacy in many downstream tasks. Nevertheless, it highly depends on the hypothesis that the embedded watermarks in the network outputs are consistent. When the attacker uses some common data augmentation attacks (e.g., rotate, crop, and resize) during surrogate model training, it will totally fail because the underlying watermark consistency is destroyed. To mitigate this issue, we propose a new watermarking methodology, namely ``structure consistency'', based on which a new deep structure-aligned model watermarking algorithm is designed. Specifically, the embedded watermarks are designed to be aligned with physically consistent image structures, such as edges or semantic regions. Experiments demonstrate that our method is much more robust than the baseline method in resisting data augmentation attacks for model IP protection. Besides that, we further test the generalization ability and robustness of our method to a broader range of circumvention attacks.

研究动机与目标

  • 解决现有水印方案在深度图像处理模型面对数据增强攻击时的脆弱性问题。
  • 识别基于整图一致性的水印方法在遭遇裁剪、旋转等常见增强操作时失效的根本原因。
  • 开发一种新型水印方法论,通过与物理上有意义的图像结构(如边缘或语义区域)对齐,保持水印一致性。
  • 设计一种结构对齐的水印框架,在多种图像处理任务中保持高视觉质量与鲁棒性。

提出的方法

  • 提出一种名为“结构一致性”的新型水印方法论,将水印编码至物理上稳定的图像结构(如边缘或语义区域,例如眼睛)中。
  • 设计一个四模块框架:水印位编码器、嵌入网络、提取网络和解码器,所有模块端到端联合训练以保持水印完整性。
  • 通过Canny或语义分割检测结构后,将恒定颜色值嵌入其中,生成与结构对齐的水印,使其在几何变换下保持一致性。
  • 采用渐进式训练策略,逐步引入增强操作与损失约束,以在训练过程中提升鲁棒性。
  • 利用提取网络仅从水印图像中检测并恢复水印,确保在干净输入上无误报。
  • 将该框架应用于多种任务,包括去雨、艺术化人像生成和X光去骨处理,证明其在不同物理结构与应用场景下的泛化能力。

实验结果

研究问题

  • RQ1为何基于整图一致性的水印方法在随机裁剪和旋转等常见数据增强攻击下会失效?
  • RQ2若水印不再固定于图像位置,而是与边缘或语义区域等物理稳定结构对齐,能否保持水印一致性?
  • RQ3结构一致性如何提升对使用增强训练数据的替代模型攻击的鲁棒性?
  • RQ4该方法在不同图像处理任务及物理结构类型(如全局边缘与局部语义区域)之间,其泛化能力有多强?
  • RQ5该结构一致水印方案对神经清洗、微调和领域对抗训练等高级规避技术的抗性如何?

主要发现

  • 所提出的结构一致水印方法在强烈数据增强下仍能实现超过90%的水印提取准确率,显著优于基线的整图一致性方法,后者在类似攻击下完全失效。
  • 即使在替代模型训练数据中50%为自标注干净数据的情况下,该方法仍保持高鲁棒性,水印提取成功率达78%,尽管一致性约束已被破坏。
  • 神经清洗攻击无法检测到水印,因为其触发信号并非输入无关或位置/模式固定的,而该水印具有全局性和结构对齐特性,与攻击假设不符。
  • 使用少量干净数据进行微调后,水印提取成功率降至78%,但替代模型性能显著下降(PSNR从32.3降至28.9),降低了攻击的实际可行性。
  • 该框架在多种任务中表现出良好泛化能力:在去雨和艺术化人像生成任务中均成功提取水印,视觉结果表明感知失真极小。
  • 即使在水印被覆盖重写后,原始水印仍可被成功提取,且替代模型性能显著下降,表明对后续攻击操作具有极强的抗性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。