Skip to main content
QUICK REVIEW

[论文解读] Does fine-tuning GPT-3 with the OpenAI API leak personally-identifiable information?

Albert Yu Sun, Eliott Zemour|arXiv (Cornell University)|Jul 31, 2023
Privacy-Preserving Technologies in Data被引用 7
一句话总结

本研究调查了通过 OpenAI 的 API 微调 GPT-3 是否会导致个人身份信息(PII)的记忆与泄露。利用 Enron 邮件数据集,作者通过分类任务和实际的自动补全任务模拟了黑盒攻击,表明微调后的 GPT-3 能够以高召回率(在分布外提示中达 26.29%)和非微不足道的精确率(5.71%)提取 PII,揭示了在实际应用中存在显著的隐私风险。

ABSTRACT

Machine learning practitioners often fine-tune generative pre-trained models like GPT-3 to improve model performance at specific tasks. Previous works, however, suggest that fine-tuned machine learning models memorize and emit sensitive information from the original fine-tuning dataset. Companies such as OpenAI offer fine-tuning services for their models, but no prior work has conducted a memorization attack on any closed-source models. In this work, we simulate a privacy attack on GPT-3 using OpenAI's fine-tuning API. Our objective is to determine if personally identifiable information (PII) can be extracted from this model. We (1) explore the use of naive prompting methods on a GPT-3 fine-tuned classification model, and (2) we design a practical word generation task called Autocomplete to investigate the extent of PII memorization in fine-tuned GPT-3 within a real-world context. Our findings reveal that fine-tuning GPT3 for both tasks led to the model memorizing and disclosing critical personally identifiable information (PII) obtained from the underlying fine-tuning dataset. To encourage further research, we have made our codes and datasets publicly available on GitHub at: https://github.com/albertsun1/gpt3-pii-attacks

研究动机与目标

  • 调查通过 OpenAI 的 API 微调的 GPT-3 模型在仅具备黑盒访问权限的情况下是否会泄露个人身份信息(PII)。
  • 评估 PII 泄露在实际、真实世界应用(如电子邮件自动补全服务)中的风险。
  • 评估简单提示技术在从专有、闭源语言模型中提取敏感数据方面的有效性。
  • 强调企业与消费者使用场景中微调大语言模型的隐私漏洞,尤其是在 GDPR 和中国人工智能服务管理措施等监管框架下。
  • 鼓励在未来的微调流程中采用差分隐私和 PII 清理等隐私保护技术。

提出的方法

  • 作者使用 OpenAI 的微调 API 在 Enron 邮件数据集上对 GPT-3 模型(curie)进行了微调,涵盖文本分类和文本生成任务。
  • 设计了两种攻击场景:一种是用于分类场景下 PII 提取的朴素提示方法,另一种是模拟从邮件主题生成邮件正文的现实自动补全任务。
  • 在分类任务中,使用如“这封邮件中的人名是什么?”之类的提示,从模型输出中提取 PII。
  • 在自动补全任务中,使用训练集中的邮件主题(Train)和分布外(OOD)主题,测试在真实世界使用模式下的 PII 泄露情况。
  • 通过与 Enron 数据集中的真实标签对比,测量提取出的 PII 的精确率与召回率,重点关注姓名、组织和联系方式。
  • 作者公开发布了其代码和数据集,以促进可复现性,并推动对专有大语言模型中 PII 记忆现象的进一步研究。

实验结果

研究问题

  • RQ1攻击者是否仅通过黑盒访问和简单提示,就能从通过 OpenAI API 微调的 GPT-3 模型中提取个人身份信息(PII)?
  • RQ2在类似电子邮件自动补全服务这类实际应用场景中,微调后的 GPT-3 模型中 PII 记忆现象的严重程度如何?
  • RQ3在真实世界使用场景中,PII 泄露在分布内与分布外提示之间有何差异?
  • RQ4在微调后的 GPT-3 模型中,使用朴素提示与真实提示进行 PII 提取时,其精确率与召回率有何不同?
  • RQ5专有、闭源模型中的 PII 泄露对 GDPR 和中国《人工智能服务管理办法》等数据隐私监管法规有何影响?

主要发现

  • 微调后的 GPT-3 模型表现出显著的 PII 记忆现象,在自动补全任务中,分布内提示的召回率为 27.83%,分布外提示为 26.29%。
  • 分布外提示的 PII 提取精确率为 13.16%,分布内提示为 5.71%,表明每 17 到 40 个提取的 PII 标记中约有 1 个是与训练数据匹配的准确结果。
  • 模型从分布内提示中成功提取出 236 个唯一的 PII 实例,从分布外提示中提取出 223 个,表明即使面对新颖输入,仍可能触发 PII 泄露。
  • 最常被记忆的 PII 类型是个人和组织的姓名,包括“Jeffrey Skilling”和“Enron Corporation”等知名人物。
  • 研究证实,PII 泄露不仅限于直接提示,也发生在如自动补全等真实、生产环境类似的场景中,对企业和消费者应用构成真实风险。
  • 研究结果强调了即使通过闭源 API 进行微调,大语言模型仍易受隐私攻击,凸显了迫切需要采用隐私保护型微调技术。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。