[论文解读] Corrective Machine Unlearning
本文提出了一种名为修正型机器遗忘(Corrective Machine Unlearning)的新框架,旨在缓解仅已知受污染样本代表性子集时,已训练机器学习模型中被操纵数据的影响。与传统侧重隐私保护的遗忘方法不同,该方法聚焦于恢复受影响数据域的模型准确率,表明选择性突触阻尼(SSD)可在仅识别出10%被污染样本的情况下有效消除后门触发,而从头再训练的方法即使在识别出80%数据的情况下也完全失败。
Machine Learning models increasingly face data integrity challenges due to the use of large-scale training datasets drawn from the Internet. We study what model developers can do if they detect that some data was manipulated or incorrect. Such manipulated data can cause adverse effects including vulnerability to backdoored samples, systemic biases, and reduced accuracy on certain input domains. Realistically, all manipulated training samples cannot be identified, and only a small, representative subset of the affected data can be flagged. We formalize Corrective Machine Unlearning as the problem of mitigating the impact of data affected by unknown manipulations on a trained model, only having identified a subset of the corrupted data. We demonstrate that the problem of corrective unlearning has significantly different requirements from traditional privacy-oriented unlearning. We find most existing unlearning methods, including retraining-from-scratch without the deletion set, require most of the manipulated data to be identified for effective corrective unlearning. However, one approach, Selective Synaptic Dampening, achieves limited success, unlearning adverse effects with just a small portion of the manipulated samples in our setting, which shows encouraging signs for future progress. We hope our work spurs research towards developing better methods for corrective unlearning and offers practitioners a new strategy to handle data integrity challenges arising from web-scale training. Code is available at https://github.com/drimpossible/corrective-unlearning-bench.
研究动机与目标
- 解决在训练过程中因细微、难以察觉的操纵(如后门或误标)导致数据被污染后,恢复模型准确率的挑战。
- 形式化一种全新的遗忘范式——修正型机器遗忘,其与以隐私为导向的遗忘有本质区别,核心在于性能恢复而非数据隐私。
- 在该新设置下评估现有遗忘方法,揭示传统方法(如从头再训练)在仅部分已知被操纵数据时完全失效。
- 证明通过选择性突触阻尼(SSD)实现修正型遗忘的可行性,该方法在仅需极少已识别数据的情况下即能有效消除后门影响。
- 激励未来研究开发针对大规模网络训练模型中数据完整性问题而设计的鲁棒、自适应遗忘算法。
提出的方法
- 本文将修正型机器遗忘形式化为一个仅知被操纵样本代表性子集的问题,目标是提升受影响数据域上的干净标签准确率。
- 在两种数据操纵类型上评估了最先进的遗忘方法——包括从头再训练和SSD:BadNet风格后门投毒与类间混淆误标。
- 采用一种威胁模型,其中攻击者通过触发器或标签互换操纵数据,而模型开发者仅在训练后检测到此类样本的小部分代表性子集。
- 引入一种新评估指标,聚焦于受影响数据域上的准确率提升,而非与从头再训练结果的分布不可区分性。
- 在真实场景下进行基准测试,即完全未知数据污染程度,模拟现实世界中的数据完整性挑战。
- 提出未来方法应优先考虑在污染数据域上的准确率恢复,而非严格的隐私保证,尤其是在面对自适应攻击时。

实验结果
研究问题
- RQ1当仅识别出部分受污染样本时,现有遗忘方法能否有效恢复因未知数据操纵而受影响的数据域的模型准确率?
- RQ2为何传统遗忘方法(如从头再训练)在修正型遗忘中即使已知80%被操纵数据仍会失败?
- RQ3选择性突触阻尼(SSD)在仅识别出10%被操纵样本的情况下,能在多大程度上消除后门投毒的影响?
- RQ4为何SSD无法缓解类间混淆误标问题?这对当前遗忘方法的泛化能力有何启示?
- RQ5在何种理论与算法条件下,少量代表性被操纵样本足以实现有效的修正型遗忘?
主要发现
- 即使已识别出80%被操纵数据,从头再训练仍无法恢复受影响数据域的干净标签准确率,凸显该金标准方法在修正型遗忘中的不足。
- 选择性突触阻尼(SSD)仅需识别出10%被操纵样本,即可成功缓解BadNet风格后门投毒的影响,证明该场景下修正型遗忘的可实现性。
- SSD无法消除类间混淆误标的影响,表明当前遗忘方法在不同操纵类型间缺乏鲁棒性。
- 研究揭示了以隐私为导向的遗忘目标与数据完整性恢复需求之间存在根本性脱节,表明与从头再训练结果的不可区分性不足以实现性能修正。
- 结果强调了开发专为数据完整性问题设计的新遗忘算法的迫切需求,重点应放在准确率恢复而非隐私保证上。
- 本文识别出一个关键研究空白:目前尚无任何方法能仅凭少量代表性受污染样本,可靠地消除任意类型的数据操纵。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。