Skip to main content
QUICK REVIEW

[论文解读] RIGA: Covert and Robust White-Box Watermarking of Deep Neural Networks

Tianhao Wang, Florian Kerschbaum|arXiv (Cornell University)|Oct 31, 2019
Adversarial Robustness in Machine Learning参考文献 37被引用 14
一句话总结

RIGA 提出了一种用于深度神经网络的新型白盒水印方案,通过对抗性训练嵌入水印,实现零精度损失,同时增强隐蔽性和鲁棒性。它采用类似 GAN 的框架,将水印隐藏在模型权重中,并使用深度神经网络提取器,对检测和移除攻击(包括微调、剪枝和模型蒸馏)表现出强抵抗力。

ABSTRACT

Watermarking of deep neural networks (DNN) can enable their tracing once released by a data owner. In this paper, we generalize white-box watermarking algorithms for DNNs, where the data owner needs white-box access to the model to extract the watermark. White-box watermarking algorithms have the advantage that they do not impact the accuracy of the watermarked model. We propose Robust whIte-box GAn watermarking (RIGA), a novel white-box watermarking algorithm that uses adversarial training. Our extensive experiments demonstrate that the proposed watermarking algorithm not only does not impact accuracy, but also significantly improves the covertness and robustness over the current state-of-art.

研究动机与目标

  • 解决在安全性关键应用中对高精度、可追溯深度学习模型的迫切需求,其中水印导致的精度损失无法接受。
  • 克服现有白盒水印方案易被检测或易受移除攻击的局限性。
  • 开发一种既隐蔽(与非水印模型权重分布匹配)又对常见模型转换攻击具有鲁棒性的水印方法。
  • 通过用深度神经网络替代线性提取器,改进先前的白盒水印方案,以提升嵌入容量和抗性。

提出的方法

  • 引入一种受 GAN 启发的对抗性训练框架,其中水印模型作为生成器,水印检测器作为判别器,以在模型权重中隐藏水印。
  • 通过对抗性损失联合训练水印嵌入和提取过程,确保水印模型的权重分布与非水印模型高度接近。
  • 用深度神经网络替代先前工作中使用的线性水印提取器,以提升水印提取的容量和鲁棒性。
  • 在模型训练过程中通过优化损失函数嵌入水印,该损失函数平衡了模型精度、水印隐蔽性和提取器性能。
  • 采用两阶段训练流程:首先在水印约束下训练模型,然后微调提取器网络以可靠恢复嵌入的信息。
  • 应用对抗性正则化,最小化权重分布的统计偏差,降低被属性推断攻击检测到的风险。

实验结果

研究问题

  • RQ1能否设计一种白盒水印方案,使其既隐蔽又鲁棒,且不降低模型精度?
  • RQ2在保持模型性能的前提下,对抗性训练技术在 DNN 权重中隐藏水印的潜力有多大?
  • RQ3将线性水印提取器替换为深度神经网络,对水印方案的鲁棒性和容量有何影响?
  • RQ4所提出的水印方案对常见模型转换攻击(如微调、剪枝和蒸馏)的抗性如何?
  • RQ5在显著的模型压缩或参数修改后,水印是否仍能可靠提取?

主要发现

  • RIGA 在所有基准测试(CIFAR-10、SVHN、ImageNet)中均实现零精度损失,即使在对抗性训练和水印嵌入后仍保持模型性能。
  • 水印对属性推断攻击具有不可检测性,因为水印模型的权重分布与非水印模型高度一致。
  • RIGA 可容忍高达 99% 的权重剪枝,水印误码率(BER)极低(低于 5%),且在 95% 剪枝率下水印仍可识别。
  • 使用学习率在 0.01 至 0.05 范围内的微调攻击会导致模型精度显著下降(例如在基准 3 上降至约 40%),但水印未被成功移除。
  • 基于深度神经网络的水印提取器在所有测试攻击和模型转换下均能以高保真度成功恢复嵌入信息。
  • 即使在不同数据集的迁移学习场景下,水印移除也无效,并导致不可接受的性能损失,表明对基于适应的攻击具有强抵抗力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。