[论文解读] Flocks of Stochastic Parrots: Differentially Private Prompt Learning for Large Language Models
本文提出了 PromptDPSGD 和 PromptPATE 两种不同的差分隐私方法,用于在大型语言模型(LLMs)中学习提示词,以保护提示词中的敏感数据。PromptDPSGD 在软提示词上使用差分隐私的随机梯度下降,而 PromptPATE 则利用一个由多个 LLM 组成的集成模型(即“一群随机鹦鹉”)的噪声投票机制,将知识私密地迁移至一个单一的公共离散提示词中。该方法实现了出色的隐私-效用权衡,在使用 GPT-3 的情况下,于 SST-2 数据集上实现了 92.7% 的准确率,且满足 (ε=0.147, δ=10⁻⁶) 的差分隐私,接近非私有的基线准确率 95.2%。
Large language models (LLMs) are excellent in-context learners. However, the sensitivity of data contained in prompts raises privacy concerns. Our work first shows that these concerns are valid: we instantiate a simple but highly effective membership inference attack against the data used to prompt LLMs. To address this vulnerability, one could forego prompting and resort to fine-tuning LLMs with known algorithms for private gradient descent. However, this comes at the expense of the practicality and efficiency offered by prompting. Therefore, we propose to privately learn to prompt. We first show that soft prompts can be obtained privately through gradient descent on downstream data. However, this is not the case for discrete prompts. Thus, we orchestrate a noisy vote among an ensemble of LLMs presented with different prompts, i.e., a flock of stochastic parrots. The vote privately transfers the flock's knowledge into a single public prompt. We show that LLMs prompted with our private algorithms closely match the non-private baselines. For example, using GPT3 as the base model, we achieve a downstream accuracy of 92.7% on the sst2 dataset with ($ε=0.147, δ=10^{-6}$)-differential privacy vs. 95.2% for the non-private baseline. Through our experiments, we also show that our prompt-based approach is easily deployed with existing commercial APIs.
研究动机与目标
- 验证 LLM 中的提示词可能通过成员推理攻击泄露私有数据。
- 在不牺牲提示方法的效率与实用性的情况下,应对基于提示的 LLM 使用中的隐私风险。
- 开发适用于专有 LLM 黑盒访问(如商业 API)的私有提示学习方法。
- 利用数据高效、差分隐私的离散提示技术,实现强大的隐私-效用权衡。
- 实现与非私有方法性能相当的私有提示学习,同时满足模型访问约束。
提出的方法
- PromptDPSGD 在可学习的软提示嵌入上执行差分隐私的随机梯度下降,同时保持 LLM 参数冻结。
- PromptPATE 构建一个 LLM 的“群集”,每个模型使用来自私有数据集的不同离散提示词进行提示,以生成预测。
- 对群集的 token 预测结果进行噪声多数投票,实现差分隐私,并将知识迁移至单一公共离散提示词中。
- 学生提示词由噪声聚合输出推导得出,可用于推理中替代私有提示词。
- 该方法依赖于对 LLM 的黑盒访问,因此可与 GPT-3 和 Claude 等商业 API 部署使用。
- 通过组合定理跟踪隐私会计,实现形式化的差分隐私保障。
实验结果
研究问题
- RQ1成员推理攻击能否有效破坏用于 LLM 提示词中的数据隐私?
- RQ2能否在不损失模型效用的前提下,使用差分隐私梯度下降对软提示词进行私有化训练?
- RQ3能否在无需梯度访问的情况下,通过基于集成的知识迁移方式私有化学习离散提示词?
- RQ4在强隐私预算下,私有提示学习中的隐私-效用权衡行为如何表现?
- RQ5在仅使用对 LLM 的黑盒访问条件下,私有提示学习能否达到与非私有提示相当的性能?
主要发现
- 成员推理攻击成功判断出某数据点是否被用于提示词,验证了基于提示的 LLM 使用中的隐私风险。
- PromptDPSGD 实现了高效的私有软提示学习,具备差分隐私保障,且训练成本低,效用表现优异。
- PromptPATE 在 SST-2 数据集上实现了 92.7% 的准确率,且满足 (ε=0.147, δ=10⁻⁶) 的差分隐私,使用 GPT-3 时接近非私有基线的 95.2%。
- 仅需 100 次对群集的公共查询,PromptPATE 即可达到接近饱和的性能,表明其具有极高的数据效率。
- 由于教师模型之间共识度高,每次查询的隐私成本较低,从而减少了信息泄露,提升了隐私-效用权衡。
- 随着更强大的 LLM 和更大的上下文窗口,性能进一步提升,表明该方法具备可扩展性与未来私有提示应用的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。