[论文解读] Membership Inference Attacks against Machine Learning Models
本文提出了一种成员推理攻击方法,仅通过黑盒访问机器学习模型,即可判断特定数据记录是否属于该模型的训练集。通过训练一个影子模型来模仿目标模型的行为,并利用该影子模型指导攻击模型区分训练数据与非训练数据,作者在谷歌服务上实现了94%的中位准确率,在亚马逊服务上实现了74%的准确率,即使对数据分布一无所知亦可实现。
We quantitatively investigate how machine learning models leak information about the individual data records on which they were trained. We focus on the basic membership inference attack: given a data record and black-box access to a model, determine if the record was in the model's training dataset. To perform membership inference against a target model, we make adversarial use of machine learning and train our own inference model to recognize differences in the target model's predictions on the inputs that it trained on versus the inputs that it did not train on. We empirically evaluate our inference techniques on classification models trained by commercial "machine learning as a service" providers such as Google and Amazon. Using realistic datasets and classification tasks, including a hospital discharge dataset whose membership is sensitive from the privacy perspective, we show that these models can be vulnerable to membership inference attacks. We then investigate the factors that influence this leakage and evaluate mitigation strategies.
研究动机与目标
- 研究机器学习模型如何通过预测输出泄露其训练数据的信息。
- 解决成员推理的根本问题:确定特定数据记录是否属于模型的训练数据集。
- 开发一种实用的黑盒攻击方法,无需访问模型参数或架构,仅通过API级查询即可实施。
- 量化不同模型和数据集(包括敏感的医疗数据)中成员信息泄露的程度。
- 评估缓解策略,并识别影响泄露程度的关键因素,如模型过拟合和数据集特性。
提出的方法
- 开发一种影子训练技术,用于生成用于攻击模型训练的合成训练数据,其中每个数据点的成员状态均明确可知。
- 训练多个影子模型,以模拟目标模型的行为,使用来自目标模型黑盒查询的合成数据、统计人口数据,或目标训练数据的噪声版本。
- 训练一个推理模型,通过分析训练输入与非训练输入之间的预测置信度差异,判断给定输入是否属于目标模型的训练集。
- 将目标模型的预测置信度(例如,Softmax概率)作为攻击模型的输入特征,利用模型对训练样本通常更具置信度的特性。
- 将训练好的攻击模型应用于谷歌预测API和亚马逊ML的真实世界模型,而无需了解底层学习算法或模型架构。
- 在不同假设下评估该攻击:对数据分布有完整先验知识、通过噪声数据获得部分知识,以及在完全使用合成数据的情况下无先验知识。
实验结果
研究问题
- RQ1黑盒机器学习模型在多大程度上会通过其预测输出泄露关于训练数据的成员信息?
- RQ2当攻击者对目标模型训练所用数据分布一无所知时,成员推理攻击的有效性如何?
- RQ3哪些因素(如模型过拟合、数据集大小或分类任务)对成员推理攻击的成功率影响最大?
- RQ4即使无法访问模型参数,是否仍能有效针对谷歌和亚马逊等商业机器学习即服务平台实施成员推理攻击?
- RQ5用于影子模型的数据生成策略(如合成数据、噪声数据或真实数据)如何影响最终成员推理攻击的性能?
主要发现
- 当使用真实数据集时,成员推理攻击在使用谷歌预测API训练的模型上达到94%的中位准确率,在亚马逊ML服务上达到74%的准确率。
- 即使在对数据分布完全无先验知识的情况下,仅使用完全合成数据训练影子模型,该攻击在谷歌训练的模型上仍能达到90%的准确率。
- 该攻击在敏感数据集(如医院住院记录)上依然有效,其中成员身份具有高度隐私敏感性,表明存在真实世界的隐私风险。
- 在商业平台默认配置下训练的模型会泄露显著的成员信息,表明标准机器学习部署实践对这类攻击存在明显漏洞。
- 攻击的成功率与过拟合的标准度量指标(如训练准确率和泛化差距)高度相关,表明过拟合是成员信息泄露的关键促成因素。
- 与所提出的成员推理方法不同,模型反演攻击无法生成实际的训练样本,也无法确定成员状态,而本文方法能以高准确率直接回答成员问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。