Skip to main content
QUICK REVIEW

[论文解读] Fingerprinting Multi-exit Deep Neural Network Models via Inference Time

Tian Dong, Han Qiu|arXiv (Cornell University)|Oct 7, 2021
Adversarial Robustness in Machine Learning参考文献 26被引用 4
一句话总结

本文提出了一种针对多出口深度神经网络模型的新型指纹技术,该技术利用推理时间而非预测输出来验证知识产权所有权。通过设计能引发特定内部出口处独特且可测量的推理时间成本的指纹样本,该方法在对抗性训练、模型剪枝和结构修改下均表现出高度唯一性和鲁棒性,相较于现有基于预测结果的指纹技术,在多种架构和数据集上表现更优。

ABSTRACT

Transforming large deep neural network (DNN) models into the multi-exit architectures can overcome the overthinking issue and distribute a large DNN model on resource-constrained scenarios (e.g. IoT frontend devices and backend servers) for inference and transmission efficiency. Nevertheless, intellectual property (IP) protection for the multi-exit models in the wild is still an unsolved challenge. Previous efforts to verify DNN model ownership mainly rely on querying the model with specific samples and checking the responses, e.g., DNN watermarking and fingerprinting. However, they are vulnerable to adversarial settings such as adversarial training and are not suitable for the IP verification for multi-exit DNN models. In this paper, we propose a novel approach to fingerprint multi-exit models via inference time rather than inference predictions. Specifically, we design an effective method to generate a set of fingerprint samples to craft the inference process with a unique and robust inference time cost as the evidence for model ownership. We conduct extensive experiments to prove the uniqueness and robustness of our method on three structures (ResNet-56, VGG-16, and MobileNet) and three datasets (CIFAR-10, CIFAR-100, and Tiny-ImageNet) under comprehensive adversarial settings.

研究动机与目标

  • 解决多出口深度神经网络模型在实际部署中缺乏有效知识产权保护的问题。
  • 克服现有指纹和水印技术依赖预测输出的局限性,这些技术易受对抗性训练和结构操纵的影响。
  • 设计一种既具备唯一性(可将目标模型与独立训练的模型区分开来)又具备鲁棒性(抵抗模型微调、剪枝和对抗性重训练)的指纹技术。
  • 在不修改模型权重或注入后门的前提下实现可靠的产权验证,确保与现成模型的兼容性。

提出的方法

  • 该方法生成一组专门设计的指纹样本,可触发目标多出口模型中指定内部分类器的早期退出,从而形成独特的推理时间签名。
  • 其利用这些样本的推理时间成本对模型内部结构和层特定计算高度敏感的特性,生成可区分的时间指纹。
  • 指纹生成过程不依赖预测标签,因此对因重训练、剪枝或结构修改导致的模型准确率变化具有鲁棒性。
  • 采用基于阈值的验证机制,通过比较可疑模型在指纹样本上的推理时间进行验证,在多种对抗性设置下均表现出高真正例率。
  • 通过EEC AUC分数和IP验证率对方法进行评估,以量化在各种攻击场景下的唯一性和鲁棒性。
  • 指纹样本通过极小扰动(L2分数 < 0.05)生成,确保视觉不可感知性,同时保持强时间指纹区分度。

实验结果

研究问题

  • RQ1是否可以将推理时间作为多出口DNN模型的可靠且独特的指纹信号,而无需依赖预测输出?
  • RQ2所提出的推理时间指纹技术在对抗性训练、模型微调以及结构修改(如IC重训练或移除)下的鲁棒性如何?
  • RQ3在使用相同架构和数据集独立训练的模型中,该方法在产权验证时的唯一性保持程度如何?
  • RQ4该方法在不同DNN架构(ResNet-56、VGG-16、MobileNet)和数据集(CIFAR-10、CIFAR-100、Tiny-ImageNet)上的表现如何?
  • RQ5调整阈值 $T_f$ 对误报率与验证准确率之间的权衡有何影响?

主要发现

  • 该方法在标准对抗性扰动(RAD=5)下,对100个独立模型和100个影子模型的平均IP验证率达到0.99,证明了其高度唯一性。
  • 即使在强对抗性训练(RAD=15)下,该方法在ResNet-56和VGG-16上的验证率仍保持在0.98,而基线方法因预测标签偏移而大多失效。
  • 在模型微调下,该方法依然保持鲁棒性,80个微调模型的EEC AUC分数平均高于0.98,显示退化程度极低。
  • 指纹样本与原始图像之间的L2分数始终低于0.05,证实了视觉不可感知性,同时保持了强时间指纹区分度。
  • 该方法在唯一性和鲁棒性方面均优于当前最先进的基于预测结果的指纹技术,尤其在对抗性训练和结构修改下表现更优。
  • 阈值调优表明,$T_f = 0.005$ 达到最佳平衡,在RAD=5下对独立模型的验证率为0.99,对影子模型为0.98,而更高阈值会降低准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。