Skip to main content
QUICK REVIEW

[论文解读] PrivacyMind: Large Language Models Can Be Contextual Privacy Protection Learners

Yijia Xiao, Yiqiao Jin|arXiv (Cornell University)|Oct 3, 2023
Privacy-Preserving Technologies in DataComputer Science被引用 3
一句话总结

本文提出隐私保护语言模型(PPLM),一种新颖的微调范式,使大型语言模型在学习领域特定知识的同时保护敏感的个人身份信息(PII)。通过采用包含正样本和负样本的指令微调,该方法有效降低了隐私泄露——在隐私泄露评分上降低了33.8%,且未牺牲知识获取能力,确立了大型语言模型作为具备隐私保护能力的学习者的能力。

ABSTRACT

The proliferation of Large Language Models (LLMs) has driven considerable interest in fine-tuning them with domain-specific data to create specialized language models. Nevertheless, such domain-specific fine-tuning data often contains contextually sensitive personally identifiable information (PII). Direct fine-tuning of LLMs on this data without privacy protection poses a risk of data leakage of sensitive PII during inference time. To address this challenge, we introduce Contextual Privacy Protection Language Models (PrivacyMind), a novel paradigm for fine-tuning LLMs that effectively injects domain-specific knowledge while safeguarding inference-time data privacy. Our work offers a theoretical analysis for model design and benchmarks various techniques such as corpus curation, penalty-based unlikelihood in training loss, instruction-based tuning, etc. Extensive experiments across diverse datasets and scenarios demonstrate the effectiveness of our approaches. In particular, instruction tuning with both positive and negative examples stands out as a promising method, effectively protecting private data while enhancing the model's knowledge. Our work underscores the potential for Large Language Models as robust contextual privacy protection learners. The complete code and data for the work can be found at https://github.com/Yijia-Xiao/PrivacyMind.

研究动机与目标

  • 解决在包含敏感个人身份信息(PII)的领域特定数据上微调大型语言模型时,隐私保护不足的挑战。
  • 克服传统PII屏蔽或删除方法导致的信息显著损失和模型性能下降的局限性。
  • 提出一种新范式——隐私保护语言模型(PPLM),使大型语言模型能够区分公开可分享的知识与机密信息。
  • 在不依赖昂贵或不稳定的强化学习人类反馈(RLHF)等方法的前提下,实现知识注入与隐私保护的同步达成。
  • 为设计真实世界隐私敏感应用场景中稳健的隐私感知微调策略,提供理论指导与实证验证。

提出的方法

  • 提出一种新颖的微调框架PPLM,将隐私保护直接整合到大型语言模型的学习过程中。
  • 采用基于指令的微调,结合正样本与负样本,教导模型在何时披露或隐藏敏感信息。
  • 引入基于惩罚的非似然损失,以抑制模型在训练过程中生成私有标记。
  • 利用PII上下文分类器,基于上下文线索指导模型识别敏感内容。
  • 应用直接偏好优化(DPO)以优化模型行为,使其生成更具隐私保护特性的输出。
  • 开展语料库整理,平衡数据质量与隐私风险,最大限度减少微调过程中敏感信息的暴露。
Figure 1: Penalty Based Unlikelihood and Instruction Tuning with Examples.
Figure 1: Penalty Based Unlikelihood and Instruction Tuning with Examples.

实验结果

研究问题

  • RQ1大型语言模型能否在上下文中有效区分公开可分享的知识与敏感的个人身份信息(PII)?
  • RQ2如何在不损害知识获取能力或下游任务性能的前提下,将隐私保护整合到大型语言模型微调中?
  • RQ3哪些微调策略——如指令微调、损失惩罚或分类器引导——最有效地减少PII泄露,同时保持模型实用性?
  • RQ4与传统数据清洗或RLHF相比,结合正负样本的指令微调在隐私-效用权衡中是否表现更优?
  • RQ5动态训练过程是否能够实现知识注入与隐私保护的平衡共进化,如ROUGE、BERTScore和隐私泄露评分等指标所示?

主要发现

  • 采用正负样本指令微调(IT$_{PN_2}$)实现了最强的隐私保护效果,在wikidoc_patient_information数据集上相比原始微调模型,隐私泄露评分降低了33.8%。
  • 采用IT$_{PN_2}$训练的模型保持了高水平的知识保留,在LLaMA2-13B模型上ROUGE-L得分为0.216,与原始微调基线的0.215相当。
  • 隐私泄露评分在训练初期上升后逐渐下降,表明随着训练推进,模型学会了抑制PII生成,尤其是在指令微调设置下更为明显。
  • 理论分析证实,所提方法——尤其是结合负样本的指令微调——可形成稳定优化路径,有效平衡知识注入与隐私保护。
  • 与数据删除或替换相比,指令微调在显著降低隐私风险的同时保留了更多有用信息,在效用与隐私指标上均表现更优。
  • 指令微调与PII上下文分类器的结合,使LLaMA2-13B模型的隐私泄露评分降低了26.8%,优于DPO与基于惩罚的方法。
(a) ROUGE/BERTScore Curve
(a) ROUGE/BERTScore Curve

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。