[论文解读] On the Necessity of Auditable Algorithmic Definitions for Machine Unlearning
本文认为,当前对机器遗忘的定义——尤其是基于参数相似性的近似遗忘——从根本上存在缺陷,因为相同的模型参数可能源自不同的数据集,导致仅通过检查最终模型权重无法验证遗忘是否真正发生。作者得出结论:遗忘只能在算法层面进行有意义的审计,即遗忘过程本身必须可验证且透明,以确保数据被正确删除。
Machine unlearning, i.e. having a model forget about some of its training data, has become increasingly more important as privacy legislation promotes variants of the right-to-be-forgotten. In the context of deep learning, approaches for machine unlearning are broadly categorized into two classes: exact unlearning methods, where an entity has formally removed the data point's impact on the model by retraining the model from scratch, and approximate unlearning, where an entity approximates the model parameters one would obtain by exact unlearning to save on compute costs. In this paper, we first show that the definition that underlies approximate unlearning, which seeks to prove the approximately unlearned model is close to an exactly retrained model, is incorrect because one can obtain the same model using different datasets. Thus one could unlearn without modifying the model at all. We then turn to exact unlearning approaches and ask how to verify their claims of unlearning. Our results show that even for a given training trajectory one cannot formally prove the absence of certain data points used during training. We thus conclude that unlearning is only well-defined at the algorithmic level, where an entity's only possible auditable claim to unlearning is that they used a particular algorithm designed to allow for external scrutiny during an audit.
研究动机与目标
- 识别现有近似遗忘定义中的根本缺陷,这些定义依赖于遗忘后模型与重新训练模型之间的参数相似性。
- 证明仅凭模型参数无法验证遗忘,因为相同参数可由不同训练数据产生。
- 表明即使模型权重完全相同,也无法通过检查权重来形式化证明遗忘。
- 主张唯有通过可验证的算法级验证——即对遗忘过程本身进行可审计的审查——才能确保正确执行遗忘。
- 提出未来遗忘系统必须设计为具备可验证、透明的算法,以实现信任与监管审计。
提出的方法
- 引入‘可伪造性’(forgeability)概念,即两个数据集(一个包含特定数据点,一个不包含)可通过梯度更新产生完全相同或近乎相同的模型参数。
- 证明在不同小批量数据上执行的梯度下降步骤,即使数据点不同,也能产生相同的参数更新。
- 形式化提出:学习过程由模型轨迹定义,而不仅仅是最终参数,因此基于参数的遗忘验证本质上不可靠。
- 通过在标准模型和数据集上的实证实验,表明可通过在小批量中替换训练样本而不改变模型更新,从而‘伪造’出遗忘效果。
- 提出审计应从模型参数转向算法过程,例如可审计的训练或遗忘过程的审计日志。
- 主张唯有通过严格审查遗忘的算法实现,才能验证数据影响是否真正被移除。
实验结果
研究问题
- RQ1能否通过比较遗忘后模型与不包含该数据点的重新训练模型的最终参数,来可靠地验证遗忘?
- RQ2是否可能从两个不同数据集(一个包含、一个不包含特定训练点)中产生相同的模型参数?
- RQ3‘可伪造性’数据集的存在是否破坏了基于参数相似性的近似遗忘定义的有效性?
- RQ4能否仅通过检查模型参数,形式化证明某个数据点的影响已从模型中完全消除?
- RQ5为实现可信且可审计的机器遗忘,所需的抽象层次是参数级还是算法级?
主要发现
- 由于小批量中梯度更新的非唯一性,可通过两个不同数据集(一个包含、一个不包含特定数据点)实现完全相同的模型参数。
- 相同模型参数可通过不同训练轨迹获得,因此参数相似性无法证明遗忘已发生。
- 依赖于与重新训练模型参数接近程度的近似遗忘方法存在根本缺陷,因为其无法区分已学习与已遗忘的模型。
- 仅通过检查模型权重无法审计遗忘,因为相同权重可能源于包含或不包含该数据点的训练过程。
- 唯一可靠的验证方式是通过算法透明性,例如可审计的训练流程或可验证的遗忘过程日志。
- ‘可伪造性’概念揭示:若不对训练过程施加约束,数据对模型行为的归属关系将变得模糊,从而损害公平性与性能分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。