[论文解读] Right to be Forgotten in the Era of Large Language Models: Implications, Challenges, and Solutions
本文探讨了在大型语言模型(LLMs)中实施被遗忘权(RTBF)所面临的挑战,提出了一系列技术解决方案,如差分隐私、机器遗忘、模型编辑和提示工程。研究指出,LLMs 的数据保留机制与搜索引擎存在根本性差异,因此需要新的合规策略,在保护隐私权利的同时兼顾模型的实用性。
The Right to be Forgotten (RTBF) was first established as the result of the ruling of Google Spain SL, Google Inc. v AEPD, Mario Costeja González, and was later included as the Right to Erasure under the General Data Protection Regulation (GDPR) of European Union to allow individuals the right to request personal data be deleted by organizations. Specifically for search engines, individuals can send requests to organizations to exclude their information from the query results. It was a significant emergent right as the result of the evolution of technology. With the recent development of Large Language Models (LLMs) and their use in chatbots, LLM-enabled software systems have become popular. But they are not excluded from the RTBF. Compared with the indexing approach used by search engines, LLMs store, and process information in a completely different way. This poses new challenges for compliance with the RTBF. In this paper, we explore these challenges and provide our insights on how to implement technical solutions for the RTBF, including the use of differential privacy, machine unlearning, model editing, and guardrails. With the rapid advancement of AI and the increasing need of regulating this powerful technology, learning from the case of RTBF can provide valuable lessons for technical practitioners, legal experts, organizations, and authorities.
研究动机与目标
- 分析将被遗忘权(RTBF)应用于大型语言模型(LLMs)所面临的法律与技术挑战,这些挑战与传统搜索引擎在数据处理方面存在显著差异。
- 识别现有 RTBF 执法机制在应用于 LLMs 时的局限性,特别是关于数据保留、模型记忆化以及合规时间线的问题。
- 评估新兴技术方案(如机器遗忘、模型编辑和基于提示的指令遵循)作为 LLMs 中实现 RTBF 合规性的可行路径。
- 为从业者、监管机构和组织提供关于生成式 AI 系统中 RTBF 义务的法律与技术见解。
- 倡导重新审视法律解释,如‘合法利益’和‘不合理的延迟’,以适应 LLMs 实时、高影响力部署的现实。
提出的方法
- 利用差分隐私限制单个训练数据对模型输出的影响,降低记忆化风险。
- 应用机器遗忘技术,包括通过牛顿步长估算影响和追踪权重更新,以近似实现从 LLMs 中删除数据。
- 采用模型编辑方法,将训练后修改的存储与应用与原始模型分离,从而在保留原始模型的同时实现针对性行为变更。
- 利用提示工程将 RTBF 指令注入推理提示中,使 LLMs 能够在请求下屏蔽或省略特定数据。
- 评估每种方法的权衡,特别是遗忘技术中的过度遗忘问题以及编辑方法中知识更新的不一致性。
- 在 LLMs 部署背景下,分析 GDPR 下的法律解释,包括‘不合理的延迟’标准和‘合法利益’的正当性。

实验结果
研究问题
- RQ1LLMs 的数据存储与处理机制与传统搜索引擎有何不同?这对 RTBF 合规性有何影响?
- RQ2现有技术方法(如机器遗忘、模型编辑和提示工程)在多大程度上能有效支持 LLMs 中的 RTBF 请求?
- RQ3在强制执行 LLMs 的 RTBF 时,面临哪些关键技术与法律挑战,包括过度遗忘、提示注入攻击以及合规时间线问题?
- RQ4当前对 GDPR 的法律解释(如‘合法利益’和‘不合理的延迟’)如何适用于通常被标记为‘研究预览’的基于 LLM 的系统?
- RQ5被遗忘权在多大程度上可作为未来人工智能监管的先例,特别是在平衡隐私权与生成式 AI 快速部署之间?
主要发现
- LLMs 以与搜索引擎截然不同的方式存储和处理个人数据,由于模型记忆化和参数级数据保留机制,传统 RTBF 机制不再适用。
- 尽管机器遗忘技术前景可观,但存在过度遗忘的风险,可能降低模型性能并损害其可用性。
- 模型编辑方法虽保留了原始模型,但可能导致下游知识更新不一致,尤其是在修改多个数据点时。
- 提示工程可通过指示 LLMs 隐去特定数据来模拟 RTBF 行为,但无法真正从模型中删除数据,且易受提示注入攻击影响。
- ‘不合理的延迟’(通常为一个月)的法律标准对于 LLMs 来说可能难以实现,因为重训练或遗忘过程复杂且规模庞大。
- 使用‘研究预览’标签来为不合规辩护在法律上可能站不住脚,尤其是当 LLMs 越来越被商业化部署时。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。