[论文解读] RelaxLoss: Defending Membership Inference Attacks without Losing Utility
本文提出 RelaxLoss,一种新颖的防御框架,通过有意放松目标训练损失,缩小训练与测试损失分布之间的泛化差距,从而降低成员推理攻击(MIA)的脆弱性。通过最小化这些分布的可区分性,RelaxLoss 有效防御了多种 MIA 攻击——包括黑盒和白盒攻击——同时保持或甚至提升模型效用,在五个不同数据集上优于最先进防御方法。
As a long-term threat to the privacy of training data, membership inference attacks (MIAs) emerge ubiquitously in machine learning models. Existing works evidence strong connection between the distinguishability of the training and testing loss distributions and the model's vulnerability to MIAs. Motivated by existing results, we propose a novel training framework based on a relaxed loss with a more achievable learning target, which leads to narrowed generalization gap and reduced privacy leakage. RelaxLoss is applicable to any classification model with added benefits of easy implementation and negligible overhead. Through extensive evaluations on five datasets with diverse modalities (images, medical data, transaction records), our approach consistently outperforms state-of-the-art defense mechanisms in terms of resilience against MIAs as well as model utility. Our defense is the first that can withstand a wide range of attacks while preserving (or even improving) the target model's utility. Source code is available at https://github.com/DingfanChen/RelaxLoss
研究动机与目标
- 解决深度学习模型在医疗、金融等敏感领域部署时,持续存在的成员推理攻击(MIAs)隐私威胁。
- 降低训练与测试损失分布之间的可区分性,这是 MIA 成功的关键因素。
- 开发一种防御机制,在提供对多样化 MIA 的强韧性的同时,保持或提升模型效用。
- 克服现有防御方法的局限性,如差分隐私(会降低效用)和对抗训练(假设已知攻击模型)。
- 提供一种简单、即插即用的防御方案,适用于任何分类模型,且实现开销极低。
提出的方法
- 提出 RelaxLoss,一种训练框架,通过将目标损失调整至更易实现的水平,减少训练与测试损失分布之间的差距。
- 利用一个关键洞察:训练与测试损失差异越大,成员隐私风险越高,这一发现由 Yeom 等人(2018)证实。
- 通过贝叶斯最优攻击者模型形式化防御机制,证明最小化损失分布差异可降低攻击成功率。
- 在训练过程中应用松弛损失,无需修改模型架构,可轻松集成到现有流水线中。
- 使用超参数控制松弛程度,实现隐私与效用之间的平衡。
- 证明 RelaxLoss 增加了训练损失的方差,并减少了成员与非成员损失分布之间的重叠差距,使 MIA 效果降低。
实验结果
研究问题
- RQ1是否存在一种防御机制可在不降低模型效用的前提下减少成员推理攻击的成功率?
- RQ2缩小训练与测试损失之间的泛化差距在多大程度上可降低 MIA 的脆弱性?
- RQ3一种简单且保持效用的防御方法是否能泛化到多种数据模态和攻击类型?
- RQ4RelaxLoss 在隐私-效用权衡方面与最先进防御方法(如标签平滑、DP-SGD 和对抗正则化)相比如何?
- RQ5松弛损失方法在黑盒和白盒成员推理攻击下是否依然有效?
主要发现
- 在所有五个数据集(包括 CIFAR-10、Texas100 和 Purchase100)上,RelaxLoss 在黑盒和白盒攻击下均将攻击 AUC 稳定降低至接近随机猜测水平(≈0.5)。
- 在 Texas100 和 Purchase100 上,RelaxLoss 优于标签平滑方法,后者仅将 AUC 降低至 0.55–0.8 范围,且在强攻击下无法达到随机猜测水平。
- DP-SGD 表现矛盾:较小的噪声尺度可降低攻击 AUC,但理论隐私保证较弱;较大的尺度则显著降低效用——凸显理论与实践之间的鸿沟。
- 与正则化方法(如 Dropout、权重衰减)不同,RelaxLoss 有效增加了训练损失的方差,并减少了成员与非成员损失分布之间的差距,从而解释了其更优的防御性能。
- RelaxLoss 在所有数据集上均保持或提升模型效用,而 DP-SGD 和对抗防御方法则始终降低效用。
- 该方法具有普适性,实现开销极低,适用于隐私敏感应用的实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。