[论文解读] Don't Forget to Sign the Gradients!
GradSigns 是一种用于深度神经网络的新型黑盒数字水印框架,通过在交叉熵损失相对于模型输入的期望梯度中引入统计偏差,嵌入所有权签名。该方法实现了鲁棒、高容量的水印嵌入,准确率损失可忽略不计,并可通过 API 远程验证,相较于先前方法在鲁棒性、容量和对抗已知攻击的可信度方面表现更优。
Engineering a top-notch deep learning model is an expensive procedure that involves collecting data, hiring human resources with expertise in machine learning, and providing high computational resources. For that reason, deep learning models are considered as valuable Intellectual Properties (IPs) of the model vendors. To ensure reliable commercialization of deep learning models, it is crucial to develop techniques to protect model vendors against IP infringements. One of such techniques that recently has shown great promise is digital watermarking. However, current watermarking approaches can embed very limited amount of information and are vulnerable against watermark removal attacks. In this paper, we present GradSigns, a novel watermarking framework for deep neural networks (DNNs). GradSigns embeds the owner's signature into the gradient of the cross-entropy cost function with respect to inputs to the model. Our approach has a negligible impact on the performance of the protected model and it allows model vendors to remotely verify the watermark through prediction APIs. We evaluate GradSigns on DNNs trained for different image classification tasks using CIFAR-10, SVHN, and YTF datasets. Experimental results show that GradSigns is robust against all known counter-watermark attacks and can embed a large amount of information into DNNs.
研究动机与目标
- 为应对商业和机器学习即服务(MLaaS)环境中深度学习模型作为重要知识产权日益增长的保护需求。
- 开发一种黑盒水印方法,允许通过 API 远程验证模型所有权,而无需访问模型权重或架构。
- 克服现有水印技术的局限性,如容量低(仅 1 位)以及易受移除或伪造攻击的影响。
- 确保水印对模型准确率的影响可忽略不计,同时在各种对抗性攻击下仍可被检测到。
- 为真实世界部署场景中证明深度学习模型的所有权,提供可信、高效且可扩展的解决方案。
提出的方法
- GradSigns 通过修改模型输入特征相对于交叉熵损失的期望梯度来嵌入水印。
- 利用一组输入模式作为载体集,在梯度分布中引入统计偏差,根据水印位的值调整梯度符号。
- 水印在训练阶段通过使用水印密钥和伪随机函数生成的带符号扰动来调整梯度更新而嵌入。
- 水印提取通过在一组水印密钥图像上估计期望梯度,并分析符号偏差以恢复嵌入的签名。
- 该方法采用逐坐标梯度估计方法,样本数量经调优以平衡准确率与验证成本。
- 验证通过 API 访问完成,实现无需白盒访问模型即可远程证明所有权。
实验结果
研究问题
- RQ1黑盒水印方法能否在保持高模型准确率的同时,向 DNN 嵌入超过 1 位的信息?
- RQ2该水印对通用和自适应反水印攻击(包括微调、蒸馏和梯度掩蔽)的鲁棒性如何?
- RQ3能否仅通过 API 查询可靠地提取水印,而无需访问模型权重或架构?
- RQ4实现准确水印提取且验证成本低的最小样本数量是多少?
- RQ5在未访问原始训练数据的情况下,攻击者是否可行伪造有效水印?
主要发现
- GradSigns 在 CIFAR-10、SVHN 和 YTF 数据集上训练的 DNN 中成功嵌入了 16 位、32 位和 64 位水印,性能下降可忽略不计(准确率损失低于 1%)。
- 在所有测试的通用和自适应反水印攻击下,包括微调、知识蒸馏和梯度掩蔽,检测率达到 100%。
- 在 CIFAR-10 和 SVHN 上,每比特水印提取所需查询少于 500 次;在 YTF 上少于 100 次,表明具有高效率。
- 该方法具有高度可信性:伪造虚假水印需要每类至少 4,096 个样本的数据集,这在威胁模型下不可行,且会导致性能下降。
- 当每类使用 4,096 个样本时,伪造水印的 BESR(误符号率)为 1.0,表明无成功伪造;伪造尝试下性能最高下降 4.43%。
- 即使在对抗性微调和模型蒸馏后,水印仍可被检测到,证实其在实际威胁场景中的强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。