Skip to main content
QUICK REVIEW

[论文解读] Model Weight Theft With Just Noise Inputs: The Curious Case of the Petulant Attacker

Nicholas Roberts, Vinay Uday Prabhu|arXiv (Cornell University)|Dec 19, 2019
Adversarial Robustness in Machine Learning参考文献 9被引用 8
一句话总结

本文展示了仅通过独立同分布的伯努利噪声输入和对Softmax层输出的访问,即可实现卷积神经网络权重的盗取,在MNIST上达到96%的测试准确率,在KMNIST上达到82%。主要贡献在于揭示了模型可提取性与数据集复杂度(尤其是空间相关性)之间的关联,并提出了一种基于提取后性能比的新数据集复杂度度量指标。

ABSTRACT

This paper explores the scenarios under which an attacker can claim that 'Noise and access to the softmax layer of the model is all you need' to steal the weights of a convolutional neural network whose architecture is already known. We were able to achieve 96% test accuracy using the stolen MNIST model and 82% accuracy using the stolen KMNIST model learned using only i.i.d. Bernoulli noise inputs. We posit that this theft-susceptibility of the weights is indicative of the complexity of the dataset and propose a new metric that captures the same. The goal of this dissemination is to not just showcase how far knowing the architecture can take you in terms of model stealing, but to also draw attention to this rather idiosyncratic weight learnability aspects of CNNs spurred by i.i.d. noise input. We also disseminate some initial results obtained with using the Ising probability distribution in lieu of the i.i.d. Bernoulli distribution.

研究动机与目标

  • 探究在无真实训练数据访问的情况下,仅通过随机噪声输入和Softmax访问是否能够有效盗取模型权重。
  • 探讨输入噪声分布(特别是空间相关性)对模型可提取性的影响。
  • 提出一种基于使用噪声输入进行模型提取难度的新数据集复杂度度量指标。
  • 评估不同噪声分布(尤其是伊辛模型)对权重盗取成功率的影响。
  • 揭示即使使用非信息性输入,CNN也存在权重盗取的脆弱性,强调其对网络架构和数据分布的依赖性。

提出的方法

  • 使用参数p=0.5的伯努利分布,程序化生成600,000张二值随机图像作为输入刺激。
  • 将每张随机图像输入受害模型的Softmax层,收集类别概率分布作为标签。
  • 使用随机输入及其对应的Softmax输出作为监督标签,从零开始训练新模型。
  • 使用伊辛模型生成具有空间相关性的噪声输入,并与i.i.d.噪声分布的性能进行比较。
  • 通过在原始测试集上的提取后验证准确率,并与提取前的准确率进行归一化,来衡量模型可提取性。
  • 改变伊辛模型的逆温度β,以研究其对提取性能和泛化能力的影响。

实验结果

研究问题

  • RQ1是否可以仅使用i.i.d.伯努利噪声作为输入和Softmax层访问,有效盗取深度神经网络的权重?
  • RQ2输入噪声分布的选择(尤其是具有空间相关性的伊辛模型)如何影响模型提取的成功率?
  • RQ3数据集内在复杂度(通过提取后与提取前准确率的比值衡量)在多大程度上反映了其可学习性和结构特性?
  • RQ4为何伊辛模型在模型提取中优于i.i.d.噪声分布?这揭示了空间相关性对模型权重学习的何种作用?
  • RQ5伊辛模型中的温度参数β如何影响被盗模型的泛化能力和准确率?

主要发现

  • 仅使用i.i.d.伯努利噪声输入,盗取的MNIST模型在验证集上达到95.93%的准确率,相当于原始模型性能的96.87%。
  • 对于KMNIST,盗取模型达到81.18%的准确率,为原始模型94.79%准确率的85.64%。
  • 伊辛模型在β=0.3时取得最高提取准确率,达到MNIST上的98.02%,显著优于i.i.d.噪声分布。
  • 伊辛模型的成功归因于其对空间相关性的建模能力,而i.i.d.噪声分布(如伯努利、高斯或Gumbel)则缺乏这种特性。
  • 性能比(提取后/提取前准确率)可作为数据集复杂度的有效代理指标,其中MNIST最易被提取,notMNIST最难(比值为0.1181)。
  • 在改变β时,损失和准确率曲线中观察到奥卡姆山效应,MNIST、KMNIST和Fashion MNIST在β=0.3时性能最优,而notMNIST在β=0.8时表现最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。