[论文解读] The Janus Interface: How Fine-Tuning in Large Language Models Amplifies the Privacy Risks
本文提出了一种名为Janus的新型攻击方法,该方法利用大型语言模型(LLMs)的微调机制,恢复并披露此前被隐藏的个人身份信息(PII),例如电子邮件地址。通过仅用10个PII示例对GPT-3.5进行微调,该攻击在恢复隐藏电子邮件方面实现了69.9%的精确率,表明微调能够逆转灾难性遗忘,并在对齐保护机制存在的情况下暴露私密数据。
The rapid advancements of large language models (LLMs) have raised public concerns about the privacy leakage of personally identifiable information (PII) within their extensive training datasets. Recent studies have demonstrated that an adversary could extract highly sensitive privacy data from the training data of LLMs with carefully designed prompts. However, these attacks suffer from the model's tendency to hallucinate and catastrophic forgetting (CF) in the pre-training stage, rendering the veracity of divulged PIIs negligible. In our research, we propose a novel attack, Janus, which exploits the fine-tuning interface to recover forgotten PIIs from the pre-training data in LLMs. We formalize the privacy leakage problem in LLMs and explain why forgotten PIIs can be recovered through empirical analysis on open-source language models. Based upon these insights, we evaluate the performance of Janus on both open-source language models and two latest LLMs, i.e., GPT-3.5-Turbo and LLaMA-2-7b. Our experiment results show that Janus amplifies the privacy risks by over 10 times in comparison with the baseline and significantly outperforms the state-of-the-art privacy extraction attacks including prefix attacks and in-context learning (ICL). Furthermore, our analysis validates that existing fine-tuning APIs provided by OpenAI and Azure AI Studio are susceptible to our Janus attack, allowing an adversary to conduct such an attack at a low cost.
研究动机与目标
- 探究对LLM进行微调是否能够触发因灾难性遗忘而被遗忘的PII的恢复与披露。
- 评估微调作为绕过基于对齐的隐私保护机制(如RLHF)的有效性。
- 探索仅使用少量PII实例进行微调,是否可行实现对隐藏PII的重建。
- 评估在生产级LLM(如GPT-3.5)中,通过微调接口导致隐私泄露的风险。
- 提出一种新型攻击向量——Janus,利用微调恢复被遗忘的PII,揭示LLM部署中的关键隐私威胁。
提出的方法
- Janus攻击构建了一个PII关联任务,即在极小的PII实例数据集(例如10对电子邮件地址)上对模型进行微调。
- 攻击使用将人名映射到其电子邮件的提示词,训练LLM将姓名与特定PII相关联。
- 微调在模型经历灾难性遗忘之后执行,从而有效恢复PII关联任务。
- 该方法使用精确率和命中率指标,在Enron和非Enron电子邮件数据集上评估性能。
- 通过与逃逸攻击技术对比,隔离微调在逆转遗忘方面所展现的独特有效性。
- 实验使用GPT-3.5-Turbo和GPT-2模型,持续学习模拟现实世界中的多任务场景。
实验结果
研究问题
- RQ1仅用少量PII实例进行微调,是否能够恢复并暴露LLM中先前被遗忘的个人身份信息?
- RQ2Janus攻击在恢复PII方面相较于传统逃逸攻击方法的优越程度如何?
- RQ3Janus攻击在不同类型的PII或领域(如Enron与非Enron邮件)中的有效性是否存在差异?
- RQ4灾难性遗忘如何影响模型保留PII的能力?微调能否逆转这种损失?
- RQ5能否通过微调绕过RLHF等对齐机制,从而实现PII的披露?
主要发现
- 仅用10个PII示例对GPT-3.5进行微调,在Enron数据集中实现了69.9%的精确率,成功恢复隐藏的电子邮件地址。
- Janus攻击实现了100%的RLHF对齐保护绕过率,表明其在绕过隐私保护机制方面完全成功。
- 相比之下,逃逸攻击方法在同一任务上的命中率仅为6%,精确率为0%,表明其在PII恢复方面表现极差,尽管成功绕过了对齐机制。
- 在更复杂的非Enron数据集中,Janus攻击使用100个示例实现了1.9%的精确率,表明在姓名和域名提取方面存在领域特异性挑战。
- 即使微调数据量极少,该攻击依然有效,表明通过低成本干预即可实现被遗忘PII的恢复。
- 结果证实,尽管灾难性遗忘对模型性能有害,但可通过微调被利用以恢复并暴露敏感PII。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。