[论文解读] Thief, Beware of What Get You There: Towards Understanding Model Extraction Attack
本文研究了攻击者缺乏预训练模型和分布内数据场景下的模型提取攻击,证明通过基于深度强化学习(DRL)的自适应框架,仍可实现有效的模型提取。该方法动态优化查询生成与模型配置,在无任何标注数据的情况下仍优于基线技术,揭示了仅依赖数据保密性来保障模型机密性的做法是不足的。
Model extraction increasingly attracts research attentions as keeping commercial AI models private can retain a competitive advantage. In some scenarios, AI models are trained proprietarily, where neither pre-trained models nor sufficient in-distribution data is publicly available. Model extraction attacks against these models are typically more devastating. Therefore, in this paper, we empirically investigate the behaviors of model extraction under such scenarios. We find the effectiveness of existing techniques significantly affected by the absence of pre-trained models. In addition, the impacts of the attacker's hyperparameters, e.g. model architecture and optimizer, as well as the utilities of information retrieved from queries, are counterintuitive. We provide some insights on explaining the possible causes of these phenomena. With these observations, we formulate model extraction attacks into an adaptive framework that captures these factors with deep reinforcement learning. Experiments show that the proposed framework can be used to improve existing techniques, and show that model extraction is still possible in such strict scenarios. Our research can help system designers to construct better defense strategies based on their scenarios.
研究动机与目标
- 研究在真实世界AIaaS部署中常见的攻击者无法访问预训练模型和分布内数据时,模型提取攻击的有效性。
- 分析攻击者超参数(如模型架构和优化器)对提取成功率的影响,揭示其与标准训练相比的反直觉行为。
- 评估查询数据质量与生成策略的作用,特别是在数据稀缺或无数据场景下,即无标注分布内数据时。
- 开发一种自适应框架,通过深度强化学习联合优化查询策略与模型配置,以在先验知识有限的条件下提升提取性能。
- 证明仅依赖数据保密性来保障模型机密性的做法存在漏洞,呼吁在商业AI服务中采用更强的防御机制。
提出的方法
- 提出一种基于深度强化学习(DRL)的框架,通过智能体根据奖励信号选择对抗性样本,学习最优查询生成策略。
- 引入多组件奖励函数,结合交叉熵损失、输出范围正则化、标准差和平均激活值,引导DRL智能体实现高效模型提取。
- 采用演员-评论家架构(DDPG)从零开始训练DRL智能体,初始训练阶段通过高斯噪声实现探索。
- 使用控制器智能体动态调整FGSM-based查询生成过程中的噪声幅度与扰动策略。
- 在无数据或有限数据设置下实施,攻击者的数据池($D_a$)仅包含未标注或随机采样的图像,以模拟现实世界约束。
- 使用在FashionMNIST上训练的受害者模型进行验证,查询预算为$10^4$,并与随机噪声和随机控制器基线进行性能对比。
实验结果
研究问题
- RQ1当攻击者无法访问预训练模型或分布内训练数据时,模型提取的有效性如何?
- RQ2在低知识环境下,攻击者超参数(如模型架构和优化器)如何影响提取性能?
- RQ3在无标注数据的情况下,查询数据分布与生成策略在模型提取中的作用是什么?
- RQ4深度强化学习智能体能否学会自适应生成显著提升提取准确率的查询,相较于固定方法?
- RQ5在无数据场景下,模型提取能在多大程度上成功?这对依赖数据保密性的AI模型安全性意味着什么?
主要发现
- 即使在无任何分布内数据的情况下,模型提取仍具有效性,所提出的DRL框架在无数据设置下于FashionMNIST上实现了54.7%的top-1准确率。
- DRL框架优于随机噪声和随机控制器基线,在仅含20张未标注分布内图像的有限数据场景下,准确率达到75.2%。
- 在测试设置中,Adam优化器的提取性能显著劣于SGD,与常规训练直觉相悖。
- 在正常训练中会导致过拟合的学习率和训练周期,在模型提取中反而可能有益,表明存在反直觉的训练动态。
- 该框架的自适应查询生成策略降低了对人工数据整理的依赖,使在极少先验知识下仍能实现有效提取。
- 结果表明,仅依赖数据保密性来保障模型机密性是不足的,因为攻击者仍可利用DRL优化的查询提取出功能性模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。