[论文解读] EmojiPrompt: Generative Prompt Obfuscation for Privacy-Preserving Communication with Cloud-based LLMs
EmojiCrypt 是一种隐私保护型提示混淆技术,通过将大语言模型(LLM)交互中的敏感用户输入转换为表情符号序列来实现加密,确保 LLM 仍能生成准确输出,同时使原始数据对人类和 LLM 服务提供商均无法解读。该方法在无需模型微调的情况下实现了与现有方法相当或更优的任务性能,展现出强大的隐私保护能力,且性能损耗极低。
Cloud-based Large Language Models (LLMs) such as ChatGPT have become increasingly integral to daily operations. Nevertheless, they also introduce privacy concerns: firstly, numerous studies underscore the risks to user privacy posed by jailbreaking cloud-based LLMs; secondly, the LLM service providers have access to all user data, which deters individuals from confidently utilizing such services. To address such concerns, we propose a simple yet effective paradigm, EmojiPrompt, to protect user privacy. At its core, EmojiPrompt performs generative transformation, obfuscating private data within prompts with linguistic and non-linguistic elements before submitting them to cloud-based LLMs. We evaluate EmojiPrompt's performance across 8 datasets from various domains. We also propose simulated inference attacks to assess EmojiPrompt's ability to preserve user privacy. The results demonstrate that EmojiPrompt effectively obfuscates user private data, while largely maintaining, or even enhancing, performances compared to the unobfuscated version. Furthermore, EmojiPrompt's atomic-level obfuscation allows it to function exclusively with cloud-based LLMs. For source code, please refer to: https://github.com/agiresearch/EmojiCrypt.
研究动机与目标
- 解决云环境中大语言模型存在的隐私风险,即尽管用户数据在传输和存储过程中已加密,但服务提供商仍可能访问到敏感信息。
- 开发一种方法,使敏感信息在提示中对人类观察者和 LLM 本身均不可见,同时不损害输出质量。
- 通过将个人或机密数据转换为语义模糊的表情符号序列,实现与 LLM 的安全私密通信,同时保留任务相关语义。
- 评估加密提示是否能在保持高任务准确率的同时,有效防止原始敏感内容的重建。
- 证明提示加密可在无需模型微调或改变 LLM 推理流程的前提下实现有效保护。
提出的方法
- 该方法使用预训练的 LLM 作为编码器,将用户提示中的敏感元素(如姓名、产品标题或个人属性)转换为表情符号序列。
- LLM 编码器将自然语言输入映射为对 LLM 语义有意义但对人类难以理解的表情符号表示。
- 混淆后的情感符号提示随后被发送至目标 LLM(如 GPT-4 或 Gemini-Pro)执行下游任务,无需任何微调。
- 通过提示另一个 LLM(如 GPT-4)从表情符号序列中重构原始文本,进行解密评估,使用余弦相似度衡量相似性。
- 通过比较重构文本与原始文本的相似度评估鲁棒性,并利用同一数据集中的随机样本计算安全阈值,作为无关性的基线。
- 该方法在三个任务上进行评估:电子商务推荐(Amazon Beauty)、情感分析(IMDB)和财务状况分类(Census Income),分别使用 GPT-4 和 Gemini-Pro 作为编码器,GPT-4 作为解码器。
实验结果
研究问题
- RQ1基于表情符号的提示混淆能否在保护 LLM 模型生成准确响应能力的同时,有效隐藏敏感用户数据,使其对人类和 LLM 服务提供商均不可见?
- RQ2与未加密提示相比,使用表情符号加密提示是否能维持或提升 LLM 应用中的任务性能?
- RQ3原始敏感内容在多大程度上可从表情符号加密提示中被重建,从而反映混淆机制的强度?
- RQ4该加密-解密流水线在不同 LLM(如 GPT-4 与 Gemini-Pro)及不同类型数据(可重用与不可重用文本)上的性能表现如何?
- RQ5该方法是否可普遍适用于多种自然语言处理任务,而无需模型微调或架构修改?
主要发现
- 在使用 GPT-4 进行加密和解密时,EmojiCrypt 在 Amazon Beauty 数据集上实现了原始与重构产品标题之间 0.567 的余弦相似度,显著低于 0.307 的最优安全阈值,表明混淆效果极强。
- 在 IMDB 评论数据集上,GPT-4 + GPT-4 的相似度得分为 0.755,Gemini + GPT-4 为 0.607,两者均超过 0.411 的最优安全阈值,证实重构文本与原始文本在语义上仍明显不同。
- 在 Census Income 数据集上,GPT-4 + GPT-4 的相似度得分为 0.461,Gemini + GPT-4 为 0.467,两者均高于 0.295 的最优安全阈值,证明了有效数据掩蔽。
- 在个性化推荐、情感分析和表格数据分析三项任务中,EmojiCrypt 在无需模型微调的情况下,均保持或提升了任务准确率。
- 该方法有效防止了原始敏感内容的重建,因为加密提示与同一数据集中随机样本的平均相似度始终低于安全阈值,证实了其鲁棒性。
- 结果表明,LLM 能够以高保真度处理表情符号加密提示,表明尽管表情符号表示看似随机,但语义信息在混淆过程中仍被有效保留。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。