Skip to main content
QUICK REVIEW

[论文解读] Repairing Neural Networks by Leaving the Right Past Behind

Ryutaro Tanno, Melanie F. Pradier|arXiv (Cornell University)|Jul 11, 2022
Adversarial Robustness in Machine Learning被引用 8
一句话总结

本文提出了一种贝叶斯持续学习框架,通过识别并删除导致模型失效的有害训练样本,实现对神经网络的修复。通过近似反事实后验分布来实现数据删除,该方法在失效原因识别和模型修复方面均优于影响函数和数据删除基线方法,其中EWC-influence实现了准确且高效的检测,EWC-deletion则在失效集准确率与泛化能力之间取得了更优的平衡。

ABSTRACT

Prediction failures of machine learning models often arise from deficiencies in training data, such as incorrect labels, outliers, and selection biases. However, such data points that are responsible for a given failure mode are generally not known a priori, let alone a mechanism for repairing the failure. This work draws on the Bayesian view of continual learning, and develops a generic framework for both, identifying training examples that have given rise to the target failure, and fixing the model through erasing information about them. This framework naturally allows leveraging recent advances in continual learning to this new problem of model repairment, while subsuming the existing works on influence functions and data deletion as specific instances. Experimentally, the proposed approach outperforms the baselines for both identification of detrimental training data and fixing model failures in a generalisable manner.

研究动机与目标

  • 开发一种通用的、以数据为中心的方法,在模型部署后修复机器学习模型,而无需从头开始重新训练。
  • 在根本原因事先未知的情况下,识别导致测试数据中特定失效模式的最具破坏性的训练样本。
  • 通过贝叶斯持续学习视角,高效地擦除模型对这些有害样本的“记忆”,实现模型修复。
  • 将现有方法(如影响函数和数据删除)统一并扩展到一个统一的原理性框架下。
  • 证明数据层面的干预——特别是有针对性的删除——能够有效修复模型失效,同时保持非失效案例的性能。

提出的方法

  • 该框架通过假设特定训练数据的缺失,建模反事实后验分布,将其形式化为一个贝叶斯持续(反)学习问题。
  • 利用近似推理来估计在移除特定训练样本后模型参数的后验分布,从而识别出具有影响力的样本点。
  • 该方法将弹性权重固化(EWC)扩展用于估计影响分数(EWC-influence),以识别对特定失效模式最具危害性的训练样本。
  • 在模型修复中,应用EWC-deletion——一种EWC的变体——在通过EWC-influence识别出最具有影响力样本后,对模型进行微调。
  • 该方法对失效源不敏感,能统一处理标签噪声和输入级污染(如对抗性样本)等情况。
  • 通过在查询集上使用早停策略调整超参数,以平衡失效案例与其余测试分布上的性能。

实验结果

研究问题

  • RQ1我们能否自动识别出在部署系统中导致特定模型失效的训练样本?
  • RQ2如何在不从头重新训练或修改模型架构的情况下,修复模型在失效案例上的性能?
  • RQ3在影响估计的引导下,数据删除在多大程度上能提升模型鲁棒性,同时保持泛化能力?
  • RQ4与现有影响函数和数据删除方法相比,所提出的框架在识别和移除有害数据方面表现如何?
  • RQ5能否将持续学习技术(如EWC)通过影响估计和选择性删除重新用于模型修复?

主要发现

  • EWC-influence在识别最具破坏性的训练样本方面优于基线影响函数和随机选择,尤其在检测模糊或错误标注的样本时表现更优。
  • 在带有标注噪声的MNIST数据集上,EWC-deletion在失效集准确率与剩余数据集性能之间的权衡上优于Newton-update-deletion,接近全量微调的性能。
  • 在CIFAR-10数据集上使用对抗性污染时,EWC-deletion使失效集准确率相比Newton-update-deletion提高了5%,且在剩余测试集上的性能下降不足1%。
  • 该方法的运行时间与基线方法相当或更快,证明了其在实际部署中的高效性。
  • 通过重新训练移除所有污染输入并未显著提升失效集准确率,表明EWC-influence成功隔离了最具危害性的异常值,而不仅仅是噪声数据。
  • 该框架将影响函数和数据删除作为特例涵盖在内,揭示了它们的局限性,并在统一的贝叶斯持续学习视角下实现了整合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。