Skip to main content
QUICK REVIEW

[论文解读] Editing a classifier by rewriting its prediction rules

Shibani Santurkar, Dimitris Tsipras|arXiv (Cornell University)|Dec 2, 2021
Data Stream Mining Techniques被引用 4
一句话总结

本文提出一种方法,通过重写模型隐藏层中的特征表示,直接编辑分类器的预测规则,从而在无需额外数据收集的情况下实现行为修改。该方法仅需一个合成样本,即可纠正模型在虚假相关性(如误分类雪景或对抗性字体攻击)上的失败,显著提升鲁棒性和泛化能力,优于微调方法。

ABSTRACT

We present a methodology for modifying the behavior of a classifier by directly rewriting its prediction rules. Our approach requires virtually no additional data collection and can be applied to a variety of settings, including adapting a model to new environments, and modifying it to ignore spurious features. Our code is available at https://github.com/MadryLab/EditingClassifiers .

研究动机与目标

  • 解决分类器从有偏见的训练数据中学习到不可靠、依赖上下文的预测规则的问题。
  • 开发一种直接、数据高效的后训练模型行为修改方法,避免昂贵的数据收集过程。
  • 实现对由虚假相关性(如环境变化或对抗性扰动引起)导致的模型失败进行针对性修正。
  • 通过操纵特定概念的潜在表示,提供可扩展的分类器编辑工具包。
  • 在实际场景中展示该方法的实用性,包括领域偏移和对抗性攻击。

提出的方法

  • 该方法通过修改分类器的权重矩阵,将特定层中目标概念(如“雪”)的表示重新定向,使其与参考概念(如“沥青路”)的表示对齐。
  • 利用单个合成样本计算该层权重的秩一更新,以最小化对其他表示的干扰。
  • 通过使用分割掩码对编辑过程进行约束,保留不含目标概念区域的原始映射,从而提升泛化能力。
  • 利用预训练实例分割模型(如 MS-COCO 或 LVIS)识别概念,实现对高层特征的自动发现。
  • 该方法结合风格迁移与分割技术,构建概念转换流水线,用于生成多样化的测试案例以供评估。
  • 该方法适用于视觉模型(如 VGG16、ResNet)和零样本模型(如 CLIP),展现出广泛的适用性。

实验结果

研究问题

  • RQ1我们能否在不收集新数据的情况下,通过直接重写模型内部表示来修改分类器的预测规则?
  • RQ2该方法在纠正由环境变化(如降雪)引起的虚假相关性导致的模型失败方面有多有效?
  • RQ3该方法在未见样本和训练分布之外的新概念上的泛化能力有多强?
  • RQ4与标准微调相比,该方法在纠正由概念级变换引发的模型错误方面表现如何?
  • RQ5同一套编辑框架能否用于探测和识别已训练模型中的虚假预测规则?

主要发现

  • 该方法能有效纠正因概念级变换(如将“道路”替换为“雪”)导致的大量模型失败,其表现优于标准微调方法,后者常导致错误增加。
  • 在更新过程中使用掩码进行编辑可提升性能,通过保留非目标区域的原始表示,表明该方法具有正则化效果。
  • 在 ImageNet 和 Places365 分类器上,该方法减少了因概念变换导致的准确率下降;例如,当“树”被修改时,VGG16 在“三趾树懒”上的准确率最高下降达 30%,而该方法成功缓解了这一问题。
  • 通过编辑模型使其忽略物理贴纸上“iPod”文字,该方法成功防御了 CLIP 面临的“字体攻击”,恢复了模型鲁棒性。
  • 概念转换流水线实现了反事实图像的可扩展生成,揭示了模型对特定概念的依赖关系,暴露了虚假相关性。
  • 模型对基于纹理的变换(如“涂鸦”、“秋色”)比对基于材质的变换(如“木质”、“金属”)更敏感,而该方法能有效纠正此类问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。