[论文解读] On the Privacy Risks of Algorithmic Recourse
本文提出了一种基于反事实距离的成员推理攻击,利用算法可追溯性来推断某个数据实例是否属于模型的训练数据。通过分析实例与其生成的反事实之间的距离,作者展示了显著的隐私泄露——尤其在高维数据中表现突出,优于传统的基于损失的攻击方法,并揭示了在可追溯性部署中此前未被探索的关键风险。
As predictive models are increasingly being employed to make consequential decisions, there is a growing emphasis on developing techniques that can provide algorithmic recourse to affected individuals. While such recourses can be immensely beneficial to affected individuals, potential adversaries could also exploit these recourses to compromise privacy. In this work, we make the first attempt at investigating if and how an adversary can leverage recourses to infer private information about the underlying model's training data. To this end, we propose a series of novel membership inference attacks which leverage algorithmic recourse. More specifically, we extend the prior literature on membership inference attacks to the recourse setting by leveraging the distances between data instances and their corresponding counterfactuals output by state-of-the-art recourse methods. Extensive experimentation with real world and synthetic datasets demonstrates significant privacy leakage through recourses. Our work establishes unintended privacy leakage as an important risk in the widespread adoption of recourse methods.
研究动机与目标
- 探究算法可追溯性方法是否无意中泄露了关于训练数据的私密信息。
- 识别并形式化一类利用反事实距离的新成员推理攻击。
- 在多样化的真实世界与合成数据集上评估此类攻击的有效性。
- 理解此类隐私泄露最为严重时的条件。
- 强调在现实世界机器学习部署中,实现隐私保护型可追溯性生成的紧迫需求。
提出的方法
- 提出一类通用的成员推理攻击,称为基于反事实距离的攻击,利用输入实例与其算法反事实之间的距离。
- 提出两种具体攻击方法:一种基于阈值的攻击,以及一种使用反事实距离作为输入的似然比检验(LRT)。
- 在一种现实假设下运行:攻击者对每个实例只能查询一次可追溯算法,以模拟真实用户访问。
- 采用对数刻度的ROC曲线和距离分布比较,评估不同数据集和模型类型下的攻击性能。
- 使用合成数据(具有受控维度和模型容量)以及来自金融、医疗和法律领域的现实世界数据集来验证攻击。
- 将攻击性能与基线方法进行比较,包括可访问完整模型梯度和标签的基于损失的成员推理攻击。
实验结果
研究问题
- RQ1攻击者能否利用算法可追溯性判断某个给定数据实例是否属于模型的训练数据?
- RQ2实例与其反事实之间的距离如何揭示其在训练集中成员身份的信息?
- RQ3在何种数据和模型条件下(例如高维、模型过拟合)这种隐私泄露最为显著?
- RQ4基于可追溯性的攻击性能与最先进的基于损失的成员推理攻击相比如何?
- RQ5模型容量或特征维度在多大程度上会放大通过可追溯性导致的隐私泄露风险?
主要发现
- 所提出的基于反事实距离的攻击在高维数据上显著优于标准的基于损失的成员推理攻击,即使后者可访问完整的模型梯度和标签。
- 攻击性能随特征维度的增加而提升,这在高维合成数据中训练集与测试集实例的距离分布出现明显分离中得到证实。
- 在低至中等维度的真实世界表格数据集(d < 50)中,攻击性能保持中等水平,表明维度是泄露严重程度的关键因素。
- 对于非线性模型(如深度神经网络),增加模型容量会加剧攻击成功率,尤其在高维特征下,CFD LRT在高容量设置下甚至优于基于损失的LRT。
- 当模型对训练数据过拟合时,攻击最为有效,证实过拟合会加剧通过可追溯性导致的隐私泄露。
- 实证结果表明,CFD LRT在高维合成数据上实现了高AUC,表明反事实距离本身即可作为成员推理的强大信号。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。