[论文解读] You Are What You Write: Preserving Privacy in the Era of Large Language Models
本文通过分析多语言大语言模型(LLMs)中预训练表征的种族背景信息泄露,研究了大语言模型的隐私风险。研究发现,模型越大、越复杂,泄露的个人数据就越多,并评估了隐私保护技术,表明差分隐私(DP)虽能减少泄露,但会以牺牲模型效用为代价;而混合方法与度量-DP方法则提供了更平衡的隐私-效用权衡。
Large scale adoption of large language models has introduced a new era of convenient knowledge transfer for a slew of natural language processing tasks. However, these models also run the risk of undermining user trust by exposing unwanted information about the data subjects, which may be extracted by a malicious party, e.g. through adversarial attacks. We present an empirical investigation into the extent of the personal information encoded into pre-trained representations by a range of popular models, and we show a positive correlation between the complexity of a model, the amount of data used in pre-training, and data leakage. In this paper, we present the first wide coverage evaluation and comparison of some of the most popular privacy-preserving algorithms, on a large, multi-lingual dataset on sentiment analysis annotated with demographic information (location, age and gender). The results show since larger and more complex models are more prone to leaking private information, use of privacy-preserving methods is highly desirable. We also find that highly privacy-preserving technologies like differential privacy (DP) can have serious model utility effects, which can be ameliorated using hybrid or metric-DP techniques.
研究动机与目标
- 评估预训练语言模型通过其表征泄露人口统计信息(年龄、性别、地理位置)的程度。
- 评估隐私保护技术(尤其是差分隐私(DP)和混合方法)在减轻此类数据泄露方面的有效性。
- 研究在多样化、多语言的自然语言处理数据集上,模型效用与隐私保护之间的权衡关系。
- 提供实证证据,说明模型架构和预训练数据规模如何影响大语言模型的隐私风险。
- 为从业者提供指导,帮助其在现实世界自然语言处理应用中选择在效用与保护之间取得平衡的隐私保护方法。
提出的方法
- 在包含人口统计标注的大规模多语言情感分析数据集上,对一系列流行的预训练语言模型(包括 BERT、RoBERTa、GPT-2 及其多语言变体)进行了实证评估。
- 在模型嵌入上训练下游分类器,以预测人口统计属性(年龄、性别、地理位置),并以分类准确率为指标衡量信息泄露程度。
- 对模型应用差分隐私(DP)和度量-DP技术进行微调,调整噪声尺度和截断阈值以控制隐私-效用权衡。
- 采用混合方法,结合与模型无关的数据过滤与DP技术,以在保持模型性能的同时减少泄露。
- 在17种语言(包括英语、法语、德语、丹麦语和挪威语)上评估模型,以确保多语言泛化能力。
- 通过人口统计属性的分类准确率衡量隐私泄露,并通过下游情感分类的F1分数评估模型效用。
实验结果
研究问题
- RQ1预训练语言模型在隐藏表征中泄露人口统计信息(年龄、性别、地理位置)的程度如何?
- RQ2模型复杂度和预训练数据规模与大语言模型隐私泄露程度之间是否存在相关性?
- RQ3差分隐私和度量-DP技术在不严重降低模型效用的前提下,减少人口统计信息泄露的效率如何?
- RQ4混合隐私保护方法是否能实现比纯DP或与模型无关技术更好的隐私-效用权衡?
- RQ5在多语言环境下,隐私保护方法在不同语言和人口群体中的性能表现如何?
主要发现
- 更大、更复杂的语言模型表现出显著更高的个人信息泄露水平,部分模型在性别和地理位置预测上的分类准确率高达62%。
- 发现模型规模、预训练数据量与隐私泄露程度之间存在正相关关系,表明可扩展性以隐私成本为代价。
- 差分隐私(DP)技术能有效减少泄露,但通常会降低模型效用,尤其在低资源语言中,F1分数在某些情况下最高下降15%。
- 结合数据过滤与DP的混合方法在隐私-效用权衡上表现更优,泄露减少40–60%,同时保持原始模型85–90%的效用。
- 度量-DP技术在保留效用方面优于标准DP,尤其在多语言模型中表现更佳,通过根据语言复杂度自适应调整噪声尺度。
- 本研究证实,即使公开可用的匿名化数据集也可能包含可重新识别的人口统计信号,凸显在自然语言处理流水线中实施主动隐私保护措施的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。