[论文解读] Model Extraction Attacks against Recurrent Neural Networks
本文提出了一种针对循环神经网络(RNNs)和长短期记忆(LSTM)网络的新型模型提取攻击,通过利用中间输出和自定义损失函数实现。结果表明,攻击者仅使用20%的训练数据和部分查询访问,即可提取出准确率高于原始LSTM的替代模型,尤其通过引入softmax温度缩放和序列级输出泄露机制,显著提升了攻击效果。
Model extraction attacks are a kind of attacks in which an adversary obtains a new model, whose performance is equivalent to that of a target model, via query access to the target model efficiently, i.e., fewer datasets and computational resources than those of the target model. Existing works have dealt with only simple deep neural networks (DNNs), e.g., only three layers, as targets of model extraction attacks, and hence are not aware of the effectiveness of recurrent neural networks (RNNs) in dealing with time-series data. In this work, we shed light on the threats of model extraction attacks against RNNs. We discuss whether a model with a higher accuracy can be extracted with a simple RNN from a long short-term memory (LSTM), which is a more complicated and powerful RNN. Specifically, we tackle the following problems. First, in a case of a classification problem, such as image recognition, extraction of an RNN model without final outputs from an LSTM model is presented by utilizing outputs halfway through the sequence. Next, in a case of a regression problem. such as in weather forecasting, a new attack by newly configuring a loss function is presented. We conduct experiments on our model extraction attacks against an RNN and an LSTM trained with publicly available academic datasets. We then show that a model with a higher accuracy can be extracted efficiently, especially through configuring a loss function and a more complex architecture different from the target model.
研究动机与目标
- 探究针对RNN和LSTM的模型提取攻击在可行性与有效性方面的潜力,此类攻击在现有文献中尚未得到充分研究。
- 开发新的攻击策略,以利用RNN和LSTM的架构特性,如序列处理机制和隐藏状态反馈。
- 证明可通过更少的资源提取出准确率高于原始模型的替代模型。
- 评估模型架构复杂度与损失函数设计对模型提取攻击成功率的影响。
- 探索现有防御措施(如水印技术和差分隐私)在应对这些高级模型提取技术时的实际效果与局限性。
提出的方法
- 针对分类任务,攻击利用LSTM模型在序列处理过程中产生的中间输出(而不仅限于最终输出),用于训练替代RNN模型。
- 采用带温度缩放的softmax,以增强模型logits中的信息量,从而提高替代模型的拟合精度。
- 针对回归任务,提出一种基于教师约束回归的新损失函数,以使替代模型的预测结果与原始模型输出对齐。
- 替代模型通过原始模型的查询响应进行训练,使用原始数据集的标签和模型预测结果作为监督信号。
- 在MNIST(转换为时间序列)和空气质量数据集上评估攻击效果,以衡量在数据和查询受限条件下的准确率与泛化能力。
- 有意将替代模型的架构设计得比原始模型更复杂,以利用架构灵活性提升性能。
实验结果
研究问题
- RQ1能否仅通过部分查询访问,从LSTM模型中提取出准确率高于原始模型的替代RNN模型?
- RQ2在基于RNN的攻击中,利用中间输出(序列中间阶段)在多大程度上提升了提取模型的质量?
- RQ3在回归任务中,自定义损失函数在多大程度上提升了替代模型的性能?
- RQ4架构复杂度在RNN和LSTM模型提取攻击的成功中起到何种作用?
- RQ5现有防御措施(如水印技术与差分隐私)在应对这些高级模型提取技术时的有效性如何?
主要发现
- 在MNIST数据集上,使用原始训练数据仅20%的替代RNN模型达到了97.5%的准确率,略高于原始LSTM模型的97.3%。
- 在空气质量数据集的回归任务中,替代模型仅用三个月的训练数据即达到87.2%的R²值,而原始模型使用十个月数据时为89.9%。
- 采用带温度缩放的softmax显著增强了原始模型的信息泄露,使替代模型具备更高的保真度。
- 攻击通过利用RNN的序列特性取得成功,其中中间隐藏状态包含仅从最终输出无法获取的可利用预测信号。
- 更复杂的替代架构优于简单架构,表明架构自由度显著提升了模型提取的成功率。
- 现有防御措施(如水印技术与差分隐私)被证明无效,因其无法阻止模型提取,且可能被蒸馏类攻击绕过。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。