[论文解读] Identifying Spurious Correlations and Correcting them with an Explanation-based Learning
该论文提出一种基于扰动的方法,通过分析均值蒙特卡洛丢弃法下的模型不确定性变化,检测图像分类器中的虚假相关性。随后利用基于解释的微调方法纠正这些相关性,减少模型对无关图像区域的依赖,提升鲁棒性,表现为微调后均值蒙特卡洛丢弃变化从0.50降至0.15。
Identifying spurious correlations learned by a trained model is at the core of refining a trained model and building a trustworthy model. We present a simple method to identify spurious correlations that have been learned by a model trained for image classification problems. We apply image-level perturbations and monitor changes in certainties of predictions made using the trained model. We demonstrate this approach using an image classification dataset that contains images with synthetically generated spurious regions and show that the trained model was overdependent on spurious regions. Moreover, we remove the learned spurious correlations with an explanation based learning approach.
研究动机与目标
- 识别图像分类器学习到的损害模型可信度的虚假相关性。
- 开发一种自动化的、基于扰动的方法,无需人工实例筛选即可检测对非必要图像区域的过度依赖。
- 利用基于解释的学习纠正虚假相关性,减少模型对混淆特征的依赖。
- 通过不确定性监控和针对性微调优化预测,提升模型鲁棒性。
提出的方法
- 通过用目标类别图像中的补丁替换4x4像素区域的方式施加图像级扰动,以模拟破坏性变化。
- 通过100次前向传播的均值蒙特卡洛丢弃法监控模型不确定性,检测预测确定性显著下降的情况。
- 将导致均值蒙特卡洛丢弃值最大下降的区域识别为虚假区域,表明存在过度依赖。
- 使用基于解释的学习(公式3)对模型进行微调,以降低对已识别虚假区域的敏感性。
- 在受控数据集中使用合成生成的虚假区域验证检测与纠正的有效性。
- 比较微调前后均值蒙特卡洛丢弃变化,量化虚假相关性影响的降低程度。
实验结果
研究问题
- RQ1在无需标注失败案例的情况下,图像级扰动能否有效识别模型预测中的虚假相关性?
- RQ2当在虚假图像区域施加扰动时,模型预测的确定性下降程度如何,从而反映其过度依赖程度?
- RQ3基于解释的学习能否成功降低模型对通过扰动分析识别出的虚假图像区域的依赖?
- RQ4在纠正虚假相关性后,不确定性变化幅度(通过均值蒙特卡洛丢弃测量)如何变化?
主要发现
- 仅使用分类损失训练的模型在受到扰动时,其均值蒙特卡洛丢弃变化达到0.50,表明对虚假区域高度敏感。
- 均值蒙特卡洛丢弃值下降最大的情况发生在对合成添加的虚假区域进行扰动时,证实了这些区域作为主要预测因子的作用。
- 经过基于解释的微调后,均值蒙特卡洛丢弃的平均变化降至0.15,表明对虚假特征的敏感性显著降低。
- 视觉检查确认,最具破坏性的扰动均针对与识别出的虚假区域一致的位置,验证了检测方法的有效性。
- 经过优化的模型在测试图像上即使受到扰动仍能保持正确预测,表明其鲁棒性提高,且对混淆特征的依赖性降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。