[论文解读] Does fine-tuning GPT-3 with the OpenAI API leak personally-identifiable information?
本研究调查了通过 OpenAI 的 API 微调 GPT-3 是否会导致个人身份信息(PII)的记忆与泄露。利用 Enron 邮件数据集,作者通过分类任务和实际的自动补全任务模拟了黑盒攻击,表明微调后的 GPT-3 能够以高召回率(在分布外提示中达 26.29%)和非微不足道的精确率(5.71%)提取 PII,揭示了在实际应用中存在显著的隐私风险。
Machine learning practitioners often fine-tune generative pre-trained models like GPT-3 to improve model performance at specific tasks. Previous works, however, suggest that fine-tuned machine learning models memorize and emit sensitive information from the original fine-tuning dataset. Companies such as OpenAI offer fine-tuning services for their models, but no prior work has conducted a memorization attack on any closed-source models. In this work, we simulate a privacy attack on GPT-3 using OpenAI's fine-tuning API. Our objective is to determine if personally identifiable information (PII) can be extracted from this model. We (1) explore the use of naive prompting methods on a GPT-3 fine-tuned classification model, and (2) we design a practical word generation task called Autocomplete to investigate the extent of PII memorization in fine-tuned GPT-3 within a real-world context. Our findings reveal that fine-tuning GPT3 for both tasks led to the model memorizing and disclosing critical personally identifiable information (PII) obtained from the underlying fine-tuning dataset. To encourage further research, we have made our codes and datasets publicly available on GitHub at: https://github.com/albertsun1/gpt3-pii-attacks
研究动机与目标
- 调查通过 OpenAI 的 API 微调的 GPT-3 模型在仅具备黑盒访问权限的情况下是否会泄露个人身份信息(PII)。
- 评估 PII 泄露在实际、真实世界应用(如电子邮件自动补全服务)中的风险。
- 评估简单提示技术在从专有、闭源语言模型中提取敏感数据方面的有效性。
- 强调企业与消费者使用场景中微调大语言模型的隐私漏洞,尤其是在 GDPR 和中国人工智能服务管理措施等监管框架下。
- 鼓励在未来的微调流程中采用差分隐私和 PII 清理等隐私保护技术。
提出的方法
- 作者使用 OpenAI 的微调 API 在 Enron 邮件数据集上对 GPT-3 模型(curie)进行了微调,涵盖文本分类和文本生成任务。
- 设计了两种攻击场景:一种是用于分类场景下 PII 提取的朴素提示方法,另一种是模拟从邮件主题生成邮件正文的现实自动补全任务。
- 在分类任务中,使用如“这封邮件中的人名是什么?”之类的提示,从模型输出中提取 PII。
- 在自动补全任务中,使用训练集中的邮件主题(Train)和分布外(OOD)主题,测试在真实世界使用模式下的 PII 泄露情况。
- 通过与 Enron 数据集中的真实标签对比,测量提取出的 PII 的精确率与召回率,重点关注姓名、组织和联系方式。
- 作者公开发布了其代码和数据集,以促进可复现性,并推动对专有大语言模型中 PII 记忆现象的进一步研究。
实验结果
研究问题
- RQ1攻击者是否仅通过黑盒访问和简单提示,就能从通过 OpenAI API 微调的 GPT-3 模型中提取个人身份信息(PII)?
- RQ2在类似电子邮件自动补全服务这类实际应用场景中,微调后的 GPT-3 模型中 PII 记忆现象的严重程度如何?
- RQ3在真实世界使用场景中,PII 泄露在分布内与分布外提示之间有何差异?
- RQ4在微调后的 GPT-3 模型中,使用朴素提示与真实提示进行 PII 提取时,其精确率与召回率有何不同?
- RQ5专有、闭源模型中的 PII 泄露对 GDPR 和中国《人工智能服务管理办法》等数据隐私监管法规有何影响?
主要发现
- 微调后的 GPT-3 模型表现出显著的 PII 记忆现象,在自动补全任务中,分布内提示的召回率为 27.83%,分布外提示为 26.29%。
- 分布外提示的 PII 提取精确率为 13.16%,分布内提示为 5.71%,表明每 17 到 40 个提取的 PII 标记中约有 1 个是与训练数据匹配的准确结果。
- 模型从分布内提示中成功提取出 236 个唯一的 PII 实例,从分布外提示中提取出 223 个,表明即使面对新颖输入,仍可能触发 PII 泄露。
- 最常被记忆的 PII 类型是个人和组织的姓名,包括“Jeffrey Skilling”和“Enron Corporation”等知名人物。
- 研究证实,PII 泄露不仅限于直接提示,也发生在如自动补全等真实、生产环境类似的场景中,对企业和消费者应用构成真实风险。
- 研究结果强调了即使通过闭源 API 进行微调,大语言模型仍易受隐私攻击,凸显了迫切需要采用隐私保护型微调技术。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。