[论文解读] Quantifying Privacy Risks of Masked Language Models Using Membership Inference Attacks
本文提出了一种基于似然比的成员推理攻击,以量化掩码语言模型(MLMs)中的隐私风险,利用参考MLM来提高对记忆化训练数据的检测能力。与以往仅依赖损失的方法不同,该方法在临床MLM上的AUC达到0.90,显著高于先前最先进方法的0.66 AUC,表明MLMs在通过记忆化导致隐私泄露方面极为脆弱。
The wide adoption and application of Masked language models~(MLMs) on sensitive data (from legal to medical) necessitates a thorough quantitative investigation into their privacy vulnerabilities -- to what extent do MLMs leak information about their training data? Prior attempts at measuring leakage of MLMs via membership inference attacks have been inconclusive, implying the potential robustness of MLMs to privacy attacks. In this work, we posit that prior attempts were inconclusive because they based their attack solely on the MLM's model score. We devise a stronger membership inference attack based on likelihood ratio hypothesis testing that involves an additional reference MLM to more accurately quantify the privacy risks of memorization in MLMs. We show that masked language models are extremely susceptible to likelihood ratio membership inference attacks: Our empirical results, on models trained on medical notes, show that our attack improves the AUC of prior membership inference attacks from 0.66 to an alarmingly high 0.90 level, with a significant improvement in the low-error region: at 1% false positive rate, our attack is 51X more powerful than prior work.
研究动机与目标
- 为解决以往针对掩码语言模型(MLMs)的成员推理攻击结果不明确的问题,这些方法仅依赖模型损失,无法区分样本的内在复杂度与真正的记忆化现象。
- 通过引入参考MLM来校准似然比,开发一种更准确的成员推理攻击,以减少样本复杂度带来的混淆影响。
- 通过严谨的统计假设检验,实证量化在敏感数据(如医疗记录)上训练的MLMs中记忆化的程度。
- 识别出增加对成员推理攻击易感性的数据特征(例如,标点符号密度)。
- 提供一个用于审计MLMs隐私风险的框架,并为设计鲁棒的隐私保护训练方法提供依据。
提出的方法
- 该攻击通过比较目标MLM与在底层数据分布上训练的参考MLM之间的似然比假设检验,评估某个样本是否可能属于训练集。
- 该方法将MLMs视为基于能量的概率模型,即使其本身不具备概率性质,也能通过能量函数估算序列概率,从而实现似然计算。
- 似然比计算为样本在目标模型下的概率与在参考模型下的概率之比,提供一个经过校准的检验统计量。
- 该攻击在基于MIMIC-III和i2b2医疗记录数据集微调的ClinicalBERT-Base模型上进行评估,使用AUC和固定假阳性率下的真正例率作为指标。
- 参考模型在分布相似但不重叠的数据子集上进行训练,以确保其反映总体分布,同时不记忆目标模型的训练数据。
- 该框架被应用于分析模型规模、序列长度以及数据特征(如标点符号)对攻击成功率的影响。
实验结果
研究问题
- RQ1掩码语言模型在多大程度上记忆了单个训练样本,且如何在不单纯依赖模型损失的前提下准确衡量这种记忆化?
- RQ2与基于损失的基线方法相比,使用参考模型的似然比检验是否能显著提升MLMs上的成员推理攻击性能?
- RQ3哪些数据特征(如长度、标点符号、复杂度)会使样本在MLMs中更容易受到成员推理攻击?
- RQ4模型规模和序列长度如何影响基于似然比的成员推理攻击在MLMs上的成功率?
- RQ5这些发现对用于微调MLMs的敏感数据(如临床记录)的隐私性有何影响?
主要发现
- 所提出的基于似然比的成员推理攻击在微调于MIMIC-III数据集的ClinicalBERT-Base模型上实现了0.90的AUC,显著优于先前基于损失的方法(仅0.66 AUC)。
- 在10%的假阳性率下,该攻击的真正例率达到79.2%,而基线方法仅为15.6%,表明检测能力有显著提升。
- 在低错误率场景(1%假阳性率)下,该攻击的效能是先前基于损失方法的51倍,凸显其在难以检测样本上的有效性。
- 含有多个非字母数字字符(如标点符号)的样本显著更易被记忆,因此更易受到成员推理攻击的影响。
- 本研究证明,基于敏感数据训练的MLMs极易发生隐私泄露,这与先前认为其隐私性优于自回归模型的观点相矛盾。
- 研究结果强调了迫切需要采用差分隐私等隐私保护训练技术,以保护MLMs中的个体数据记录。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。