[论文解读] Students Parrot Their Teachers: Membership Inference on Model Distillation
该论文表明,知识蒸馏对成员推理攻击提供的隐私保护有限,因为学生模型可以通过继承蒸馏预测中的成员信息,即使在查询无关输入时,也能‘鹦鹉学舌’式地复现教师模型的成员信息。作者表明,当数据集相似或教师模型被污染时,蒸馏无法充分保护教师和学生模型的训练数据。
Model distillation is frequently proposed as a technique to reduce the privacy leakage of machine learning. These empirical privacy defenses rely on the intuition that distilled ``student'' models protect the privacy of training data, as they only interact with this data indirectly through a ``teacher'' model. In this work, we design membership inference attacks to systematically study the privacy provided by knowledge distillation to both the teacher and student training sets. Our new attacks show that distillation alone provides only limited privacy across a number of domains. We explain the success of our attacks on distillation by showing that membership inference attacks on a private dataset can succeed even if the target model is *never* queried on any actual training points, but only on inputs whose predictions are highly influenced by training data. Finally, we show that our attacks are strongest when student and teacher sets are similar, or when the attacker can poison the teacher set.
研究动机与目标
- 评估知识蒸馏在成员推理攻击下的经验隐私保障。
- 调查蒸馏是否能有效保护教师和学生模型的训练数据免受成员推理攻击。
- 理解成员信息如何通过蒸馏从教师模型泄露至学生模型。
- 评估数据集相似性、温度超参数以及数据投毒对隐私泄露的影响。
- 探索蒸馏是否能提升学生数据或自蒸馏设置下的隐私保护。
提出的方法
- 将最先进的似然比攻击(LiRA)方法适配至蒸馏场景下的成员推理攻击。
- 在三种威胁模型下评估攻击:已知教师模型、未知教师模型以及代理模型(攻击者自行训练教师模型)。
- 使用影子模型校准成员得分,影子模型采用与目标模型相同的蒸馏流程进行训练。
- 使用CIFAR-10数据集上的真正例率(TPR)和假正例率(FPR)衡量攻击性能。
- 通过调节蒸馏损失与标准交叉熵损失之间的权重(α)来探索自蒸馏。
- 通过分析受训练数据影响的非目标输入上的预测结果,研究跨样本泄露问题。
实验结果
研究问题
- RQ1即使学生模型从未在这些示例上进行查询,成员推理攻击是否仍能成功识别教师模型训练数据中的训练样本?
- RQ2教师和学生训练数据集之间的相似性如何影响成员推理攻击的成功率?
- RQ3对教师数据集进行投毒在多大程度上会加剧蒸馏模型中的隐私泄露?
- RQ4知识蒸馏是否能为学生模型的训练数据提供有意义的隐私保护?
- RQ5自蒸馏如何影响隐私保护,特别是在学生与教师模型完全相同的情况下?
主要发现
- 蒸馏仅提供有限的隐私保护,因为成员推理攻击可利用间接查询在教师模型训练数据上达到最高73%的准确率。
- 成员信息可从无关输入的预测中推断得出——尤其是具有相似视觉特征(如红色色调)的输入,因教师模型的训练数据引发混淆。
- 当教师和学生数据集相似或教师数据集被污染时,攻击成功率最高,隐私风险显著增加。
- 即使在最弱的威胁模型(代理模型)下,攻击仍可在FPR为10⁻³时达到TPR为10⁻²,表明攻击在对手知识有限的情况下仍具高度可行性。
- 蒸馏对学生训练数据的隐私保护作用微乎其微,自蒸馏也未显著降低隐私风险。
- 蒸馏中的温度参数越高,隐私泄露越严重;当蒸馏损失权重(α > 0.5)越大时,攻击性能越强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。