[论文解读] Privacy-Preserving In-Context Learning for Large Language Models
本文提出差分隐私上下文学习(DP-ICL),一种通过在不相交的样本子集上进行集成推理并对接收的响应应用差分隐私来保护上下文学习中敏感信息的框架。该方法实现了强大的隐私-效用权衡,性能损失接近于零——例如,在 ε=3 时,SST-2 上的准确率达到 95.80%,使其在包含私有数据的实际大语言模型部署中具备可行性。
In-context learning (ICL) is an important capability of Large Language Models (LLMs), enabling these models to dynamically adapt based on specific, in-context exemplars, thereby improving accuracy and relevance. However, LLM's responses may leak the sensitive private information contained in in-context exemplars. To address this challenge, we propose Differentially Private In-context Learning (DP-ICL), a general paradigm for privatizing ICL tasks. The key idea for DP-ICL paradigm is generating differentially private responses through a noisy consensus among an ensemble of LLM's responses based on disjoint exemplar sets. Based on the general paradigm of DP-ICL, we instantiate several techniques showing how to privatize ICL for text classification and language generation. We evaluate DP-ICL on four text classification benchmarks and two language generation tasks, and our empirical results show that DP-ICL achieves a strong utility-privacy tradeoff.
研究动机与目标
- 解决上下文学习(ICL)中的隐私泄露问题,即提示中的敏感样本可能通过提示泄露攻击被提取。
- 开发一种通用、即插即用的范式,实现在不进行模型微调的情况下对 ICL 实现差分隐私。
- 在强制执行强隐私保证的同时,保持在文本分类和语言生成任务中的高效用。
- 评估在不同基准和模型规模下,隐私(ε)与性能之间的权衡。
提出的方法
- 将私有样本集划分为不相交的子集以实现并行推理。
- 在每个子集上独立生成模型响应,形成预测的集成。
- 对于文本分类,对投票直方图应用带高斯噪声的 Report-Noisy-Max,以私密方式发布多数类。
- 对于语言生成,提出两种聚合方法:嵌入空间聚合(ESA),对生成输出的语义嵌入进行隐私化处理;关键词空间聚合(KSA),使用 PTR 或联合指数机制私密选择频繁关键词。
- 使用差分隐私机制(例如,提议-测试-释放、指数机制)确保在响应聚合过程中尊重隐私预算。
- 仅向用户提供经过差分隐私保护的聚合输出,确保单个样本不会主导响应。
实验结果
研究问题
- RQ1是否可以在不进行模型微调或架构修改的情况下,使上下文学习实现差分隐私?
- RQ2如何有效将差分隐私应用于语言生成任务的高维、无限输出空间?
- RQ3在诸如文本分类和摘要生成等多样化 NLP 任务中,DP-ICL 的效用-隐私权衡如何表现?
- RQ4模型规模、样本数量和子采样率如何影响 DP-ICL 的性能和成本?
- RQ5在真实应用场景中,DP-ICL 是否能在确保强隐私保障(例如 ε ≤ 3)的同时保持高效率?
主要发现
- 在 SST-2 文本分类基准上,DP-ICL 在 ε=3 时达到 95.80% 的准确率,与非私有基线性能相当。
- 在文档摘要任务(SAMsum)中,当隐私预算严格控制在 ε=1 时,ROUGE 分数仅下降约 1%。
- 当 ε=∞ 时,DP-ICL 在不同数量的上下文样本(1 至 16 个)下性能保持稳定;但在 8 和 16 次提示时,由于子采样引入的噪声增加,性能下降约 10–20%。
- 子采样率为 0.5×10⁻² 时实现了最优的性能-成本平衡,使用 GPT-3 Babbage 在 SST-2 上完成 100 次预测的总成本仅为 0.0945 美元。
- 通过 PTR 实现的关键词空间聚合(KSA)在文档问答任务中优于 ESA,性能稳定维持至 10⁶ 次查询。
- 更大的模型(如 Davinci)表现出更好的 DP-ICL 性能,SST-2 上在 ε=1 时,准确率从 Ada 的 73.31% 提升至 Davinci 的 95.11%,表明其具备良好的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。