Skip to main content
QUICK REVIEW

[论文解读] Are Large Pre-Trained Language Models Leaking Your Personal Information?

Jie Huang, Hanyin Shao|arXiv (Cornell University)|May 25, 2022
Privacy-Preserving Technologies in Data被引用 8
一句话总结

本文研究了大规模预训练语言模型(PLMs)是否会通过区分数据记忆(保留数据)与关联(将数据与所有者关联)来泄露个人信息,特别是电子邮件地址。研究发现,尽管PLMs确实会记忆个人信息,但其将电子邮件与所有者关联的弱能力显著降低了针对性隐私泄露的风险,表明当前模型相对安全但仍存在风险。

ABSTRACT

Are Large Pre-Trained Language Models Leaking Your Personal Information? In this paper, we analyze whether Pre-Trained Language Models (PLMs) are prone to leaking personal information. Specifically, we query PLMs for email addresses with contexts of the email address or prompts containing the owner's name. We find that PLMs do leak personal information due to memorization. However, since the models are weak at association, the risk of specific personal information being extracted by attackers is low. We hope this work could help the community to better understand the privacy risk of PLMs and bring new insights to make PLMs safe.

研究动机与目标

  • 评估大规模预训练语言模型(PLMs)是否会泄露电子邮件等个人信息。
  • 区分记忆(数据保留)与关联(将数据与所有者关联)作为独立的隐私风险。
  • 评估攻击者通过使用所有者姓名作为提示从PLMs中提取特定个人信息的实际风险。
  • 提供可操作的防御策略,以减轻PLMs中的隐私泄露风险。
  • 为研究人员在发布自身模型前评估隐私风险提供指导。

提出的方法

  • 作者使用包含所有者姓名或上下文线索的提示查询PLMs,以测试模型能否生成特定的电子邮件地址。
  • 他们将‘记忆’定义并测量为:当使用其训练数据中的上下文提示时,模型生成个人电子邮件的能力。
  • 他们将‘关联’定义并测量为:当仅使用所有者姓名作为提示(无训练数据访问)时,模型生成个人电子邮件的能力。
  • 实验在公开可用的模型(如GPT-3(text-davinci-2)和GPT-Neo)上进行,使用Enron Email Dataset作为个人信息来源。
  • 通过测试不同提示模式和模型尺寸下模型生成正确电子邮件的频率,衡量攻击的成功率。
  • 提出了防御策略,包括差分隐私训练、后处理过滤器,以及基于图像的电子邮件显示等混淆技术。

实验结果

研究问题

  • RQ1大规模预训练语言模型在多大程度上记忆了电子邮件等个人信息?
  • RQ2攻击者能否通过使用所有者姓名查询模型来有效提取特定个人信息?
  • RQ3模型将个人信息与所有者关联的能力如何影响隐私泄露风险?
  • RQ4哪些因素(如提示模式、模型大小或先验知识)会提高此类攻击的成功率?
  • RQ5有哪些实际防御措施可以降低PLMs中个人信息泄露的风险?

主要发现

  • 大规模预训练语言模型确实会记忆电子邮件等个人信息,证实敏感数据可能保留在模型参数中。
  • 仅通过所有者姓名提取特定电子邮件的成功率较低,表明PLMs的关联能力较弱。
  • 更长且更具体的提示模式显著提高了攻击成功率,表明上下文可增强泄露潜力。
  • 更大的模型在泄露个人信息方面的成功率更高,表明模型规模会放大记忆风险。
  • 由于关联能力差,针对性隐私泄露风险较低,但记忆本身仍构成不可忽视的隐私威胁。
  • 差分隐私训练、后处理过滤器以及电子邮件混淆等防御策略可有效降低泄露风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。