[论文解读] Hide and Seek (HaS): A Lightweight Framework for Prompt Privacy Protection
Hide and Seek (HaS) 是一种轻量级、可本地部署的框架,通过在将提示发送到基于云的大型语言模型之前对敏感实体进行匿名化,并使用小型本地模型对输出进行去匿名化,从而在大型语言模型应用中保护用户提示的隐私。该框架在实现强隐私保护的同时,仅造成极小的性能损失,在翻译和分类任务中,其隐私抗压能力和任务性能均优于现有方法。
Numerous companies have started offering services based on large language models (LLM), such as ChatGPT, which inevitably raises privacy concerns as users' prompts are exposed to the model provider. Previous research on secure reasoning using multi-party computation (MPC) has proven to be impractical for LLM applications due to its time-consuming and communication-intensive nature. While lightweight anonymization techniques can protect private information in prompts through substitution or masking, they fail to recover sensitive data replaced in the LLM-generated results. In this paper, we expand the application scenarios of anonymization techniques by training a small local model to de-anonymize the LLM's returned results with minimal computational overhead. We introduce the HaS framework, where "H(ide)" and "S(eek)" represent its two core processes: hiding private entities for anonymization and seeking private entities for de-anonymization, respectively. To quantitatively assess HaS's privacy protection performance, we propose both black-box and white-box adversarial models. Furthermore, we conduct experiments to evaluate HaS's usability in translation and classification tasks. The experimental findings demonstrate that the HaS framework achieves an optimal balance between privacy protection and utility.
研究动机与目标
- 解决大型语言模型服务中用户提示向提供商暴露所带来的日益增长的隐私风险。
- 通过实现本地化、可逆的隐私保护,克服现有方法的局限性,例如多方计算(MPC)的高开销和匿名化的不可逆性。
- 设计一种即插即用的系统,在保护自由文本提示中的命名实体的同时,保持输出的实用性。
- 使用黑盒和白盒对抗性模型评估隐私抗压能力,确保对解密攻击的鲁棒性。
- 开源数据集和模型,以加速隐私保护型大型语言模型的研究。
提出的方法
- HaS 框架采用两种核心流程:'Hide'(匿名化)和 'Seek'(去匿名化),实现在本地对敏感实体的保护与恢复。
- 实现了两种匿名化方案:一种是使用微调后的 Bloomz 模型(560M/1.7B 参数)的生成式方法,另一种是使用预训练命名实体识别(NER)模型的基于标签的方法。
- 去匿名化过程采用一个独立的小型 Bloomz 模型(在 GPT-3.5-turbo 标注数据上微调)从大型语言模型输出中恢复原始实体,计算成本极低。
- 通过训练对抗性模型(黑盒与白盒)来评估隐私保护效果,攻击成功度量指标为精确率、召回率和 F1 分数。
- 该框架支持本地部署,无需修改基于云的大型语言模型,确保透明性与兼容性。
- 发布数据集和模型,以支持可复现性及提示隐私领域的进一步研究。
实验结果
研究问题
- RQ1轻量级、本地化的框架是否能有效保护大型语言模型提示中的敏感实体,而无需依赖计算开销巨大的多方计算(MPC)或差分隐私(DP)?
- RQ2在经过匿名化与去匿名化处理后,HaS 框架在翻译和文本分类等下游任务中的输出实用性如何?
- RQ3在黑盒与白盒设置下,HaS 的匿名化方案对对抗性解密攻击的抗压能力如何?
- RQ4选择生成式与基于标签的匿名化方法,对隐私保护强度与效用损失有何影响?
- RQ5尽管存在匿名化导致的信息损失,去匿名化模型在多大程度上能准确恢复原始实体?
主要发现
- 使用 560M 参数生成式匿名化方案在分类任务中取得了 91.36% 的微 F1 分数,仅比无混淆基线高出 0.17%,表明效用损失极小。
- 基于标签的方案微 F1 分数下降了 1.16%,表明效用退化更明显,但仍保持了较强的性能表现。
- 在翻译任务中,560M 生成式模型的 METEOR 分数下降了 5.65%,基于标签的模型下降了 4.86%,表明实现了可接受的效用保留。
- 白盒攻击模型在生成式方案上的宏 F1 分数为 0.3212,表明即使在完全访问模型的情况下,该方案仍具备较强抗压能力。
- 黑盒攻击模型的宏 F1 分数为 0.3147,表明匿名化在知识有限的条件下依然具有鲁棒性。
- 去匿名化模型在基于标签的混淆文本上表现更优,实现了更高的去匿名化准确率,表明尽管信息损失更高,基于标签的混淆方式可能更具可逆性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。