Skip to main content
QUICK REVIEW

[论文解读] Understanding and Testing Generalization of Deep Networks on Out-of-Distribution Data

Rui Hu, Jitao Sang|arXiv (Cornell University)|Nov 17, 2021
Anomaly Detection Techniques and Applications参考文献 50被引用 4
一句话总结

本文提出了一种新颖的OOD测试范式,通过识别标准分布内(ID)测试中的失败,来评估深度神经网络在分布外(OOD)数据上的泛化能力。它提出了一种统一的三类分布偏移分类——边缘、条件和联合分布偏移,并证明ID测试的失败源于虚假相关性;所提出的OOD测试能够识别有害的无关特征,从而实现针对性的模型调试并提升实际性能。

ABSTRACT

Deep network models perform excellently on In-Distribution (ID) data, but can significantly fail on Out-Of-Distribution (OOD) data. While developing methods focus on improving OOD generalization, few attention has been paid to evaluating the capability of models to handle OOD data. This study is devoted to analyzing the problem of experimental ID test and designing OOD test paradigm to accurately evaluate the practical performance. Our analysis is based on an introduced categorization of three types of distribution shifts to generate OOD data. Main observations include: (1) ID test fails in neither reflecting the actual performance of a single model nor comparing between different models under OOD data. (2) The ID test failure can be ascribed to the learned marginal and conditional spurious correlations resulted from the corresponding distribution shifts. Based on this, we propose novel OOD test paradigms to evaluate the generalization capacity of models to unseen data, and discuss how to use OOD test results to find bugs of models to guide model debugging.

研究动机与目标

  • 填补评估深度神经网络在分布外(OOD)数据上性能的空白,因为标准的分布内(ID)测试无法反映真实世界的表现。
  • 探究为何ID测试结果无法泛化到OOD场景,特别是在分布偏移条件下。
  • 开发一种实用的OOD测试框架,基于模型的OOD泛化能力来评估和调试模型。
  • 识别出在真实世界部署中损害模型性能的关键无关特征(“漏洞”)。

提出的方法

  • 提出一种统一的三类分布偏移分类:边缘、条件和联合分布偏移,以模拟OOD数据的生成。
  • 在CelebA和带颜色的MNIST数据集上,于受控的分布偏移设置下构建ID和OOD的训练/测试集。
  • 通过分析ID与OOD设置下的性能差异,诊断标准ID评估中的失败原因。
  • 识别出两类虚假相关性——边缘虚假相关性(使用无关特征)和条件虚假相关性(错误的特征-标签相关性)——作为ID测试失败的根本原因。
  • 针对已知和未知的无关特征,提出多层级受控分布偏移下的OOD测试范式。
  • 通过识别哪些无关特征显著降低性能,将OOD测试结果整合进闭环工作流,实现模型的调试。

实验结果

研究问题

  • RQ1为何标准的分布内(ID)测试无法反映深度神经网络在真实分布外(OOD)场景下的实际性能?
  • RQ2在OOD泛化场景中,ID测试失败的潜在原因是什么?
  • RQ3如何设计一种可靠的OOD测试范式,以评估和比较模型在未见数据上的泛化能力?
  • RQ4OOD测试结果能否用于识别和调试深度学习模型中的有害无关特征?
  • RQ5边缘和条件虚假相关性在损害OOD泛化能力方面起到什么作用?

主要发现

  • ID测试无法反映实际OOD性能,因为模型在分布偏移下学习了虚假相关性,导致性能估计产生误导。
  • 边缘和条件虚假相关性——分别源于无关特征分布的偏移和错误的标签依赖关系——直接导致ID测试失败。
  • 实验表明,在ID设置下训练的模型在OOD数据上表现出显著的性能下降,尤其当颜色或纹理等无关特征被错误使用时。
  • 所提出的OOD测试范式成功检测到特定无关特征(如性别分类任务中的发色)引起的性能退化。
  • 通过分析不同层级和类型的分布偏移下的性能下降,OOD测试识别出关键的“漏洞”特征,从而支持针对性的数据或模型干预。
  • OOD测试工作流实现了测试与调试的闭环,通过特征特定的诊断指导模型改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。