Skip to main content
QUICK REVIEW

[论文解读] Fighting Fire with Fire: Avoiding DNN Shortcuts through Priming

Chuan Wen, Jianing Qian|arXiv (Cornell University)|Jun 22, 2022
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

本文提出了一种简单而有效的方法,称为“预热(priming)”,通过注入基于领域知识的辅助信号,帮助深度神经网络(DNNs)避免学习虚假捷径(例如,将背景分类为对象而非实际物体)。通过使用关键输入特征(如显著前景或最近帧)导出的预热变量来训练DNN,模型被引导学习更鲁棒、与任务相关的表征,在图像分类、模仿学习和自动驾驶基准测试中达到最先进性能。

ABSTRACT

Across applications spanning supervised classification and sequential control, deep learning has been reported to find "shortcut" solutions that fail catastrophically under minor changes in the data distribution. In this paper, we show empirically that DNNs can be coaxed to avoid poor shortcuts by providing an additional "priming" feature computed from key input features, usually a coarse output estimate. Priming relies on approximate domain knowledge of these task-relevant key input features, which is often easy to obtain in practical settings. For example, one might prioritize recent frames over past frames in a video input for visual imitation learning, or salient foreground over background pixels for image classification. On NICO image classification, MuJoCo continuous control, and CARLA autonomous driving, our priming strategy works significantly better than several popular state-of-the-art approaches for feature selection and data augmentation. We connect these empirical findings to recent theoretical results on DNN optimization, and argue theoretically that priming distracts the optimizer away from poor shortcuts by creating better, simpler shortcuts.

研究动机与目标

  • 解决DNN学习虚假捷径这一普遍问题,尤其在分布偏移下失效的情况。
  • 探究基于领域知识的预热信号是否能引导DNN优化过程,实现更鲁棒、更具泛化能力的解。
  • 证明基于近似关键输入特征的预热方法,在特征选择与数据增强方面可超越现有最先进方法。
  • 为预热为何能避免不良局部极小值提供理论依据,即通过创建更简单、结构更优的优化路径。

提出的方法

  • 基于关键输入特征(如图像中的显著前景或序列任务中的近期观测)并利用领域知识,引入一种‘预热’信号。
  • 端到端训练DNN,同时使用完整输入和预热变量,后者作为监督信号,引导注意力聚焦于相关输入区域。
  • 利用粗略的目标标签估计(例如,来自小型主干网络或启发式方法)从关键输入生成预热变量。
  • 在三种设置中应用该方法:NICO图像分类、MuJoCo连续控制和CARLA自动驾驶。
  • 预热信号无需完美;仅需在多数情况下包含与任务相关的信息即可。
  • 理论分析将预热与NTK及线性化理论关联,表明其在损失曲面中创造了更简单、更优优化的路径。

实验结果

研究问题

  • RQ1基于关键输入特征注入简单预热信号,能否提升DNN的泛化能力并减少捷径学习?
  • RQ2在避免分布偏移失败方面,预热与最先进数据增强和特征选择技术相比表现如何?
  • RQ3预热通过何种理论机制帮助优化器避免不良局部极小值?
  • RQ4当预热信号不完美或偶尔出错时,该方法是否仍有效?
  • RQ5预热能否在图像分类、模仿学习和自动驾驶等多样化任务中有效应用?

主要发现

  • 所提出的预热方法在NICO图像分类、MuJoCo连续控制和CARLA自动驾驶基准测试中,显著优于最先进数据增强与特征选择技术。
  • 在NICO数据集上,预热通过引导注意力聚焦于显著前景,有效减少了模型基于背景而非物体进行分类的捷径学习现象。
  • 在CARLA自动驾驶任务中,预热防止了模型出现‘复制猫’行为(即复制先前动作而非响应新交通信号)。
  • 实证结果表明,即使使用粗略的预热信号,预热仍能实现更强的分布偏移鲁棒性泛化。
  • 理论分析表明,预热在损失曲面中创造了更简单、结构更优的优化路径,从而降低陷入不良捷径的可能性。
  • 该方法实现简单,支持端到端训练,且无需网络架构修改,即可在多样化真实应用场景中有效应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。