[论文解读] ES Attack: Model Stealing against Deep Neural Networks without Data Hurdles
ES Attack 是一种新颖的模型窃取框架,能够在无需访问受害者模型训练数据或辅助数据集的情况下,从机器学习即服务(MLaaS)API 中重建功能等效的深度神经网络(DNN)。通过迭代生成合成数据,并利用替代模型通过知识蒸馏对其进行优化,ES Attack 的准确率比基线攻击高出 44.57%,并能绕过大多数现有防御机制。
Deep neural networks (DNNs) have become the essential components for various commercialized machine learning services, such as Machine Learning as a Service (MLaaS). Recent studies show that machine learning services face severe privacy threats - well-trained DNNs owned by MLaaS providers can be stolen through public APIs, namely model stealing attacks. However, most existing works undervalued the impact of such attacks, where a successful attack has to acquire confidential training data or auxiliary data regarding the victim DNN. In this paper, we propose ES Attack, a novel model stealing attack without any data hurdles. By using heuristically generated synthetic data, ES Attack iteratively trains a substitute model and eventually achieves a functionally equivalent copy of the victim DNN. The experimental results reveal the severity of ES Attack: i) ES Attack successfully steals the victim model without data hurdles, and ES Attack even outperforms most existing model stealing attacks using auxiliary data in terms of model accuracy; ii) most countermeasures are ineffective in defending ES Attack; iii) ES Attack facilitates further attacks relying on the stolen model.
研究动机与目标
- 解决现有模型窃取攻击中依赖受害者模型训练数据或辅助数据集的关键空白问题。
- 开发一种仅通过 API 查询和响应标签即可运行的无数据模型窃取框架。
- 评估 ES Attack 在无数据障碍条件下窃取 DNN 的有效性,并与现有方法进行比较。
- 评估现有防御机制对这种新型攻击范式的能力。
- 展示下游风险,例如利用窃取的模型发起更有效的黑箱对抗攻击。
提出的方法
- ES Attack 使用迭代的 E-Step 和 S-Step 过程:在 E-Step 中,使用来自受害者模型响应的知识蒸馏,基于合成数据训练替代模型。
- 在 S-Step 中,通过优化输入噪声以最大化模型对预测类别的置信度,利用替代模型作为受害者模型的代理来生成合成数据。
- 通过多轮迭代对合成数据进行优化,以提升其多样性并更好地表征受害者模型的决策边界。
- 使用来自受害者模型的软标签(logits)进行知识蒸馏,以将功能行为传递给替代模型。
- 通过使用替代模型生成梯度来优化数据,避免依赖从受害者模型获取梯度计算。
- 该框架设计为与架构无关,仅需对受害者模型推理 API 实现黑盒访问。
实验结果
研究问题
- RQ1是否能够成功在不访问受害者训练数据或辅助数据集的情况下实现模型窃取攻击?
- RQ2与依赖辅助数据的攻击相比,无数据模型窃取攻击在替代模型准确率方面表现如何?
- RQ3现有防御机制在多大程度上能有效应对如 ES Attack 这类无数据模型窃取攻击?
- RQ4是否可以利用窃取的模型发起比白盒攻击更有效的黑箱对抗攻击?
- RQ5ES Attack 生成的合成数据与真实数据或辅助数据集相比,其质量和多样性如何?
主要发现
- ES Attack 在无需任何训练数据或辅助数据的情况下,成功从 MLaaS 提供商处窃取 DNN,相较于使用辅助数据的基线攻击,平均准确率提升 44.57%。
- ES Attack 生成的合成数据质量与多样性高于辅助数据集,从而显著提升了替代模型的性能。
- 大多数现有防御机制,包括查询模式检测和学习率监控,对 ES Attack 均无效。
- 窃取的模型可被用于发起黑箱对抗攻击,其成功率有时甚至超过白盒攻击,凸显了模型窃取的威胁。
- 通过 ES Attack 训练的替代模型与受害者模型在功能上高度等效,即使受害者模型的架构和参数未知亦然。
- 该攻击框架在多个图像分类数据集上表现稳健,且在缺乏架构或超参数知识的情况下依然有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。