[论文解读] Evolutionary Trigger Set Generation for DNN Black-Box Watermarking
该论文提出了一种基于差分进化算法的框架,用于优化黑盒深度神经网络(DNN)水印的触发模式,显著降低了误报率——最高可达先前方法的10倍以上——同时保持对微调攻击的鲁棒性。该方法通过生成对人眼不可察觉且具有高影响力的触发模式,增强了所有权证明能力,且触发模式在不同模型间具有良好的泛化能力。
The commercialization of deep learning creates a compelling need for intellectual property (IP) protection. Deep neural network (DNN) watermarking has been proposed as a promising tool to help model owners prove ownership and fight piracy. A popular approach of watermarking is to train a DNN to recognize images with certain extit{trigger} patterns. In this paper, we propose a novel evolutionary algorithm-based method to generate and optimize trigger patterns. Our method brings a siginificant reduction in false positive rates, leading to compelling proof of ownership. At the same time, it maintains the robustness of the watermark against attacks. We compare our method with the prior art and demonstrate its effectiveness on popular models and datasets.
研究动机与目标
- 解决DNN黑盒水印中误报检测与鲁棒性之间的权衡问题。
- 通过优化既不可察觉又高度独特的触发模式,实现强身份化所有权证明。
- 通过触发模式的进化优化,降低非水印模型错误检测水印的可能性。
- 提升触发模式在不同DNN架构和数据集上的泛化能力。
- 在最小化对模型准确率影响的同时,保持水印对常见攻击(如微调)的鲁棒性。
提出的方法
- 该方法采用差分进化(DE)算法,优化添加到输入图像中的触发模式参数。
- 适应度函数设计为在保持水印模型中高触发分类准确率的同时,最小化非水印模型上的误报检测率。
- 该框架通过优化触发模式的空间位置和颜色特性,使其与自然图像分布具有最大区分度。
- DE训练期间仅使用一个水印模型(ResNet-18),但生成的触发模式在其他模型(如VGG-16、DenseNet-121和ResNet-50)上也表现出良好的泛化能力。
- 通过确保对自然图像特征的最小失真,保持模型在标准测试集上的准确率。
- 通过优化触发模式的可见性,实现不可察觉性与可检测性之间的平衡,使其在微调攻击中具有抗移除能力。
实验结果
研究问题
- RQ1进化优化能否在不损害鲁棒性的前提下降低DNN水印中的误报检测率?
- RQ2DE优化的触发模式在不同DNN架构上的泛化能力如何?
- RQ3在多大程度上可使触发模式既不可察觉又高度独特,以最小化误报?
- RQ4与现有触发集生成技术相比,该方法在微调攻击下的鲁棒性如何?
- RQ5单一优化后的触发模式能否在多个模型上作为可靠的产权证明?
主要发现
- 所提出的基于DE的触发生成方法相比基线随机密钥方法,将误报率降低了最多10倍。
- 在五个独立训练的VGG-13模型上,该方法实现了1.15% ± 0.06%的误报率,表现出强大的泛化能力。
- 微调后,DE优化密钥模式的准确率损失仅为-0.29%,而基线方法为-73.97%,显示出显著更高的鲁棒性。
- DE优化的logo模式相比先前工作将误报率提高了2倍,意味着在给定参数下,误检测概率降低了超过25,000倍。
- 该方法在标准测试集上保持了高分类准确率,仅相比非水印模型有轻微下降。
- 优化后的触发模式在微调过程中极难被移除,因其与自然数据分布的显著差异使其与正常分类行为正交。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。