[论文解读] Privacy Regularization: Joint Privacy-Utility Optimization in Language Models
本文提出了两种隐私正则化技术——使用判别器的对抗训练和一种基于三元组损失的新正则化器——以联合优化语言模型的隐私与效用。这些方法在实现更优的隐私-效用权衡、更快的训练速度以及对代表性不足用户群体更少的不公平影响方面,优于差分隐私(DP)。
Neural language models are known to have a high capacity for memorization of training samples. This may have serious privacy implications when training models on user content such as email correspondence. Differential privacy (DP), a popular choice to train models with privacy guarantees, comes with significant costs in terms of utility degradation and disparate impact on subgroups of users. In this work, we introduce two privacy-preserving regularization methods for training language models that enable joint optimization of utility and privacy through (1) the use of a discriminator and (2) the inclusion of a triplet-loss term. We compare our methods with DP through extensive evaluation. We show the advantages of our regularizers with favorable utility-privacy trade-off, faster training with the ability to tap into existing optimization approaches, and ensuring uniform treatment of under-represented subgroups.
研究动机与目标
- 解决语言模型记忆敏感训练数据(如电子邮件通信中的用户身份)带来的隐私风险。
- 克服差分隐私(DP)训练带来的显著效用下降以及对代表性不足用户群体的不公平影响。
- 开发正则化技术,实现在不依赖DP严格、统一的噪声注入机制下,对隐私与模型效用的联合优化。
- 通过最小化不同子群体之间的效用损失差异,确保对训练样本较少用户的公平对待。
- 提供一种可扩展的、基于梯度的DP替代方案,利用现有优化流程,避免繁琐的超参数调优。
提出的方法
- 训练一个判别器,从语言模型的最终隐藏状态预测输入序列的作者,利用该预测结果计算隐私损失,以惩罚表示与敏感属性之间的可链接性。
- 引入一种三元组损失正则化器,促使模型为同一作者的序列生成相似的表示,同时将不同作者的表示相互推开,从而降低作者可链接性。
- 使用组合损失函数优化语言模型:标准语言建模损失加上隐私正则化损失,实现端到端训练并兼容标准优化方法。
- 使用RNN的最后隐藏状态(或Transformer中的[CLS]标记)作为序列嵌入,用于隐私正则化,与GDPR对可链接信息的定义保持一致。
- 在训练过程中应用正则化器,防止记忆作者身份,而无需像DP-SGD那样进行梯度裁剪或噪声注入。
- 通过基于表格的重建攻击评估模型,该攻击尝试从部分提示中恢复完整的训练序列,以重建准确率衡量攻击成功率。
实验结果
研究问题
- RQ1隐私正则化技术是否能在不付出差分隐私高昂效用代价的情况下,降低模型反演攻击的风险?
- RQ2在不同数据集和困惑度水平下,所提出的正则化器与DP在隐私保护和模型效用方面的表现如何比较?
- RQ3这些正则化方法是否能缓解DP训练中观察到的对代表性不足用户群体的不公平影响?
- RQ4所提出的方法是否能通过标准优化流程实现高效训练,避免DP-SGD带来的缓慢收敛和复杂调参?
- RQ5使用部分提示进行重建攻击时,这些正则化器训练出的模型在多大程度上具有抗性?
主要发现
- 所提出的正则化器在隐私保护方面与DP相当或更优,尤其在重建合成“金丝雀”样本时表现更优,因为DP的统一噪声注入会使相关或重复序列保护不足。
- 对于高困惑度模型,未经缓解的模型在合成金丝雀样本上的重建准确率较低,但在低困惑度模型中显著上升,表明记忆现象更强。
- 在使用所提正则化器训练的模型中,隐私与效用表现均优于DP,尤其在记忆现象更可能发生的低困惑度设置下。
- 所提方法在代表性良好与代表性不足用户之间的效用损失差距仅为7个百分点,而DP为29个百分点,表明显著减少了不公平影响。
- 正则化器支持更快训练,且与标准优化技术兼容,避免了DP-SGD带来的计算开销和调参负担。
- 使用正则化器训练的模型对基于表格的重建攻击表现出强鲁棒性,攻击成功率低于DP模型,尤其在遵循语法规则的真实世界金丝雀样本上。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。