Skip to main content
QUICK REVIEW

[论文解读] HufuNet: Embedding the Left Piece as Watermark and Keeping the Right Piece for Ownership Verification in Deep Neural Networks

Peizhuo Lv, Li Pan|arXiv (Cornell University)|Mar 25, 2021
Adversarial Robustness in Machine Learning参考文献 43被引用 4
一句话总结

HufuNet 提出了一种新颖的深度神经网络(DNN)水印方案,将轻量级水印(EPH)嵌入模型的左半部分,同时将对应的密钥(SPH)保留在所有者侧以实现所有权验证。该方案在微调、剪枝、核操作以及利用对抗样本的欺诈性声明攻击下均表现出高鲁棒性,且在基准模型上性能下降可忽略不计。

ABSTRACT

Due to the wide use of highly-valuable and large-scale deep neural networks (DNNs), it becomes crucial to protect the intellectual property of DNNs so that the ownership of disputed or stolen DNNs can be verified. Most existing solutions embed backdoors in DNN model training such that DNN ownership can be verified by triggering distinguishable model behaviors with a set of secret inputs. However, such solutions are vulnerable to model fine-tuning and pruning. They also suffer from fraudulent ownership claim as attackers can discover adversarial samples and use them as secret inputs to trigger distinguishable behaviors from stolen models. To address these problems, we propose a novel DNN watermarking solution, named HufuNet, for protecting the ownership of DNN models. We evaluate HufuNet rigorously on four benchmark datasets with five popular DNN models, including convolutional neural network (CNN) and recurrent neural network (RNN). The experiments demonstrate HufuNet is highly robust against model fine-tuning/pruning, kernels cutoff/supplement, functionality-equivalent attack, and fraudulent ownership claims, thus highly promising to protect large-scale DNN models in the real-world.

研究动机与目标

  • 解决现有 DNN 水印方案在模型微调、剪枝以及基于对抗样本的欺诈性所有权声明方面存在的脆弱性问题。
  • 设计一种水印机制,在保持高模型性能的同时,确保对常见模型操作攻击具有强鲁棒性。
  • 防止攻击者利用对抗样本作为触发器伪造有效水印。
  • 实现无需暴露水印即可进行可靠、盲态的所有权验证,避免统计分析或逆向工程。
  • 为大规模 DNN 知识产权在真实场景中的部署提供一种实用、安全且隐蔽的解决方案。

提出的方法

  • HufuNet 将水印分为两部分:嵌入在 DNN 模型参数中的 Hufu 嵌入段(EPH),以及由模型所有者安全保存的 Hufu 秘密段(SPH)。
  • EPH 分布于 DNN 的几乎所有层中,仅占用参数空间的一小部分,以确保隐蔽性并抵抗统计分析。
  • 通过使用 SPH 作为密钥,将模型在特定输入(由 SPH 衍生)上的输出与预期输出进行比对,完成所有权验证。
  • 该方案设计为对核剪裁/补充、功能等价攻击以及模型微调具有鲁棒性,即使在大学习率和无标签数据下也有效。
  • 避免依赖后门触发器或带标签的对抗样本,从而降低攻击者利用对抗样本伪造声明的风险。
  • 在四个基准数据集上对五种主流 DNN 架构(CNN 和 RNN)进行了评估,以验证其鲁棒性与保真度。

实验结果

研究问题

  • RQ1水印方案在模型微调和剪枝后是否仍能保持有效性,且性能下降不显著?
  • RQ2该方案是否能抵抗利用对抗样本作为虚假触发器以伪造所有权声明的攻击?
  • RQ3能否以一种方式嵌入水印,使其难以通过层参数方差的统计分析被检测到?
  • RQ4该方案对功能等价攻击的防御效果如何,即在保持模型准确率的同时改变结构?
  • RQ5该方案是否能在多种 DNN 架构和数据集上稳定应用,且不损害模型保真度?

主要发现

  • HufuNet 在所有五种测试的 DNN 模型上对微调和剪枝均表现出高鲁棒性,且在四个基准数据集上性能下降可忽略不计。
  • 该方案成功抵御了利用对抗样本作为虚假触发器的攻击,有效防止了欺诈性所有权声明。
  • EPH 分布于几乎所有层中,显著降低了可检测的统计方差差异,从而增强了对统计分析的隐蔽性。
  • 即使在核剪裁/补充和蒸馏攻击下,HufuNet 仍能保持与原始模型几乎完全一致的准确率,性能损失极小。
  • 该方法对功能等价攻击表现出韧性,能够在不改变模型行为的前提下修改内部结构。
  • 使用 SPH 密钥进行验证时,能正确识别出水印模型,并准确拒绝非水印或已修改模型,无误报情况。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。