Skip to main content
QUICK REVIEW

[论文解读] MimosaNet: An Unrobust Neural Network Preventing Model Stealing

Kálmán Szentannai, Jalal Al-afandi|arXiv (Cornell University)|Jul 2, 2019
Adversarial Robustness in Machine Learning参考文献 8被引用 5
一句话总结

MimosaNet 提出了一种方法,通过添加保持原始功能但使网络对权重扰动高度敏感的欺骗性神经元,将一个鲁棒的、已训练好的全连接神经网络转变为一个不鲁棒的网络。该方法可防止通过噪声、微调或知识蒸馏进行模型盗取,因为即使轻微的权重变化也会导致准确率大幅下降,从而确保原始模型无法在未被检测到的情况下被克隆。

ABSTRACT

Deep Neural Networks are robust to minor perturbations of the learned network parameters and their minor modifications do not change the overall network response significantly. This allows space for model stealing, where a malevolent attacker can steal an already trained network, modify the weights and claim the new network his own intellectual property. In certain cases this can prevent the free distribution and application of networks in the embedded domain. In this paper, we propose a method for creating an equivalent version of an already trained fully connected deep neural network that can prevent network stealing: namely, it produces the same responses and classification accuracy, but it is extremely sensitive to weight changes.

研究动机与目标

  • 为应对日益严重的模型盗取威胁,即攻击者在未被检测到的情况下通过修改权重克隆已训练的模型。
  • 开发一种在保持原始网络准确率和功能的同时,使模型对权重扰动极度敏感的方法。
  • 提供一种解决方案,防止深度学习模型中知识产权的未经授权使用,且不依赖水印或混淆技术。
  • 通过使反向工程在权重变化下变得计算上不可行,实现安全地共享已训练模型。

提出的方法

  • 该方法通过在选定的全连接层中增加具有特定权重和偏置的额外神经元,创建‘欺骗性’神经元,从而扩展原有层,而不会改变原始网络的输出。
  • 通过确保新神经元在所有训练输入上的激活值为零,该变换保持了网络的输入-输出映射,从而维持原始分类准确率。
  • 该技术可迭代应用于任意内部层(不包括输入层和输出层),实现对网络的逐步脆弱化。
  • 该方法依赖于数学公式:新层权重的构造方式使得新神经元的贡献在前向传播中相互抵消,从而保持功能完整性。
  • 该方法与标准训练和推理兼容,除添加神经元外,无需对原始模型架构进行任何修改。
  • 在添加噪声、进一步训练和知识蒸馏下均表现出脆弱性,表明即使微小的权重变化也会导致显著的准确率下降。

实验结果

研究问题

  • RQ1能否将一个全连接神经网络转化为一种在保持原始准确率的同时对权重扰动高度敏感的脆弱模型?
  • RQ2该方法在通过添加噪声、微调或知识蒸馏防止模型盗取方面的有效性如何?
  • RQ3能否在不改变原始网络输出的前提下添加欺骗性神经元,以确保功能完整?
  • RQ4导致变换后网络显著准确率下降的权重噪声阈值是多少?
  • RQ5当尝试克隆一个 MimosaNet 保护的模型时,知识蒸馏的效果如何?

主要发现

  • 即使每层添加多达 72 个欺骗性神经元,MimosaNet 变换在 MNIST 上仍能保持原始分类准确率。
  • 在低至 10^-7 的噪声水平下,准确率即显著下降,表明对权重扰动具有极端敏感性。
  • 使用 SGD、AdaGrad 和 ADAM 等优化器进行进一步训练时,必须将权重距离控制在 10^-7 以下才能维持原始准确率,使得恢复变得不可行。
  • 知识蒸馏无法重建原始功能,即使在蒸馏模型中使用 128 个神经元,最大准确率也仅降至 0.17。
  • 该方法在多种扰动类型下均有效,包括噪声、微调和蒸馏,展现出对模型盗取的强大抵抗力。
  • 计算开销为多项式且可忽略不计,因为新增神经元数量相对于原始网络规模较小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。