[论文解读] How Does Data Augmentation Affect Privacy in Machine Learning?
本文挑战了数据增强可降低机器学习中隐私风险的假设,通过实证表明:针对经过数据增强训练的模型,成员推理(MI)攻击的成效可显著提升。作者提出一种新颖的集合分类方法,将增强的数据实例视为一个集合,利用排列不变特征与基于阈值或神经网络的分类器,实现在CIFAR-10上的70.1%成员推理成功率——即使在未使用数据增强训练的模型上,也超越了此前的最先进水平。
It is observed in the literature that data augmentation can significantly mitigate membership inference (MI) attack. However, in this work, we challenge this observation by proposing new MI attacks to utilize the information of augmented data. MI attack is widely used to measure the model's information leakage of the training set. We establish the optimal membership inference when the model is trained with augmented data, which inspires us to formulate the MI attack as a set classification problem, i.e., classifying a set of augmented instances instead of a single data point, and design input permutation invariant features. Empirically, we demonstrate that the proposed approach universally outperforms original methods when the model is trained with data augmentation. Even further, we show that the proposed approach can achieve higher MI attack success rates on models trained with some data augmentation than the existing methods on models trained without data augmentation. Notably, we achieve a 70.1% MI attack success rate on CIFAR10 against a wide residual network while the previous best approach only attains 61.9%. This suggests the privacy risk of models trained with data augmentation could be largely underestimated.
研究动机与目标
- 重新评估广泛持有的观点,即数据增强可缓解机器学习模型中的成员推理(MI)攻击。
- 从贝叶斯视角形式化数据增强下的最优成员推理,表明应使用增强实例的集合而非单个样本。
- 设计实用的MI攻击算法,使其在模型经数据增强训练时,优于现有方法。
- 通过实证证明,经数据增强训练的模型可能比未使用数据增强训练的模型更易受MI攻击。
- 利用群体差分隐私推导MI成功率的理论边界,表明隐私保障不会因增强次数增加而改善。
提出的方法
- 将成员推理建模为集合分类问题,输入为给定数据点的多个增强版本对应的损失值集合。
- 提出一种基于阈值的方法,以增强实例间损失的平均值作为决策统计量,受理论最优推理的启发。
- 设计一种具有排列不变特征的神经网络分类器,用于处理增强损失值的集合,确保对输入顺序的不变性。
- 基于贝叶斯后验概率与群体差分隐私,推导最优成员推理的理论边界。
- 证明:当存在 $k$ 个增强版本时,成员推理成功率的上界在 $\frac{\epsilon}{k}$-差分隐私下保持不变,与先前认为增强可提升隐私的假设相矛盾。
- 以损失值作为主要输入信号,因先前研究(Sablayrolles et al., 2019)表明其在MI攻击中比logits更有效。
实验结果
研究问题
- RQ1数据增强是否真正降低成员推理攻击的风险,还是因引入新的攻击面而意外加剧了风险?
- RQ2当模型在增强数据上训练时,最优的成员推理策略是什么?它与单一样本推理有何不同?
- RQ3基于集合的成员推理方法能否在经数据增强训练的模型上超越现有方法?
- RQ4群体差分隐私与数据增强存在时,成员推理成功率的理论上限有何关联?
- RQ5在经数据增强训练的模型上,成员推理成功率是否可能超过在未使用数据增强训练的模型上的表现?
主要发现
- 所提出的基于集合的成员推理攻击在CIFAR-10上训练的宽残差网络(测试准确率超过95%)上实现了70.1%的成功率,显著超越此前最先进水平的61.9%。
- 新攻击方法在应用于经数据增强训练的模型时,普遍优于现有MI算法。
- 即使在未使用数据增强训练的模型上,该方法的性能仍优于现有算法在经数据增强训练模型上的表现,表明数据增强可能并未如先前认为的那样降低隐私风险。
- 理论分析表明,成员推理成功率的上界在 $\frac{\epsilon}{k}$-差分隐私下保持为 $\sigma(\epsilon + \log(q/(1-q)))$,与增强次数 $k$ 无关,这与先前认为增大 $k$ 可提升隐私的假设相矛盾。
- 神经网络分类器中使用排列不变特征对性能至关重要,因其确保了对增强实例顺序的鲁棒性。
- 本研究揭示,数据增强可能放大隐私泄露而非缓解之,提示当前的隐私评估实践可能存在根本性缺陷。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。