[论文解读] What can we learn from Data Leakage and Unlearning for Law?
本文研究了微调后的大规模语言模型(LLM)中的数据泄露与遗忘问题,表明预训练数据和微调数据(包括个人身份信息PII)在文本生成过程中均可能发生泄露。研究揭示,遗忘高风险数据点可能意外增加此前安全的数据点的泄露风险,这一现象被称为“洋葱效应”,对LLM的部署带来关键的隐私与法律挑战。
Large Language Models (LLMs) have a privacy concern because they memorize training data (including personally identifiable information (PII) like emails and phone numbers) and leak it during inference. A company can train an LLM on its domain-customized data which can potentially also include their users' PII. In order to comply with privacy laws such as the "right to be forgotten", the data points of users that are most vulnerable to extraction could be deleted. We find that once the most vulnerable points are deleted, a new set of points become vulnerable to extraction. So far, little attention has been given to understanding memorization for fine-tuned models. In this work, we also show that not only do fine-tuned models leak their training data but they also leak the pre-training data (and PII) memorized during the pre-training phase. The property of new data points becoming vulnerable to extraction after unlearning and leakage of pre-training data through fine-tuned models can pose significant privacy and legal concerns for companies that use LLMs to offer services. We hope this work will start an interdisciplinary discussion within AI and law communities regarding the need for policies to tackle these issues.
研究动机与目标
- 调查微调后的LLM在文本生成过程中是否会泄露其预训练和微调数据集中的数据。
- 研究遗忘对数据集中剩余数据点隐私的影响,特别是针对PII的影响。
- 探讨LLM中数据泄露的法律与隐私影响,特别是在“被遗忘权”和数据保护法规背景下的影响。
- 推动人工智能与法律领域之间的跨学科对话,探讨缓解数据泄露与遗忘副作用的政策需求。
提出的方法
- 在WikiText-103和WikiText-2数据集上微调GPT-2,以评估领域特定微调模型中的数据泄露情况。
- 使用top-k采样(k=40)生成2000个文本样本,分别以序列开始标记和随机的Common Crawl标记作为提示。
- 通过在生成样本中搜索与微调数据集匹配的n-gram,并进行互联网搜索,检测预训练数据的泄露情况,评估记忆化程度。
- 利用困惑度和zlib熵对生成样本按记忆化可能性进行排序和排名。
- 通过精确遗忘方法,从WikiText-2数据集中移除44个高风险电子邮件地址,并重新训练GPT-2,以评估其对剩余数据点的影响。
- 利用预训练的glove-wiki-gigaword-50模型分析泄露点与遗忘点的嵌入表示,识别其空间接近性与相似性模式。

实验结果
研究问题
- RQ1微调后的LLM是否会在文本生成过程中泄露其微调数据集和预训练数据集中的人体可识别信息(PII)?
- RQ2遗忘特定高风险数据点会对数据集中其他原本安全的数据点的隐私造成何种影响?
- RQ3预训练数据(如URL、电话号码或地理位置坐标)在多大程度上会被微调模型继承并泄露?
- RQ4泄露数据点的结构特征与嵌入表示特性如何影响其在遗忘后的脆弱性?
主要发现
- 微调后的GPT-2模型泄露了实际存在的PII,如电话号码、电子邮件地址、URL和地理位置坐标,这些信息并未出现在微调数据集中,表明其源自预训练数据的继承。
- 该模型泄露了嵌入在WikiText-2中的44封来自Enron数据集的电子邮件地址,这些地址原本不在训练数据中,但通过互联网搜索被发现,证实了预训练数据的泄露。
- 在遗忘44个最易泄露的电子邮件地址后,又泄露了20个原本安全的电子邮件地址,展示了‘洋葱效应’——即遗忘操作反而增加了邻近数据点的泄露风险。
- 泄露的洋葱效应点具有更低的困惑度,并在嵌入空间中与最初泄露的电子邮件在空间上接近,表明其因语义和结构相似性而具有类似的脆弱性。
- 结果表明,遗忘可能意外损害非目标数据点的隐私,从而削弱数据最小化原则,并违反‘被遗忘权’政策的合规要求。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。