Skip to main content
QUICK REVIEW

[论文解读] Out-of-Distribution Generalization Analysis via Influence Function

Haotian Ye, Chuanlong Xie|arXiv (Cornell University)|Jan 21, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用 10
一句话总结

本文提出使用影响函数方差作为评估分布外(OOD)泛化性能的度量指标,以解决依赖于观测领域测试准确率所带来的局限性。该方法表明,与传统方法(如IRM惩罚项)相比,该指标在真实OOD分布未知或未观测到的情况下,与真实OOD准确率的相关性更强。

ABSTRACT

The mismatch between training and target data is one major challenge for current machine learning systems. When training data is collected from multiple domains and the target domains include all training domains and other new domains, we are facing an Out-of-Distribution (OOD) generalization problem that aims to find a model with the best OOD accuracy. One of the definitions of OOD accuracy is worst-domain accuracy. In general, the set of target domains is unknown, and the worst over target domains may be unseen when the number of observed domains is limited. In this paper, we show that the worst accuracy over the observed domains may dramatically fail to identify the OOD accuracy. To this end, we introduce Influence Function, a classical tool from robust statistics, into the OOD generalization problem and suggest the variance of influence function to monitor the stability of a model on training domains. We show that the accuracy on test domains and the proposed index together can help us discern whether OOD algorithms are needed and whether a model achieves good OOD generalization.

研究动机与目标

  • 为解决将观测领域上的测试准确率作为OOD泛化性能代理指标所存在的关键局限性,尤其是在真实OOD分布未被观测到时可能产生误导的情况。
  • 开发一种模型无关的度量指标,可在目标领域集合未知的情况下,可靠地判断是否需要采用OOD算法。
  • 提供一种稳定、可解释且可比较的模型鲁棒性度量方式,适用于不同算法之间的比较,且独立于超参数调优。
  • 克服IRM惩罚项作为选择指标的不足,因其可能因在惩罚项上过拟合而产生偏差,且与实际OOD性能无关。

提出的方法

  • 采用稳健统计中的影响函数,衡量模型预测对各领域训练数据点的敏感性。
  • 计算影响函数在训练领域间的方差,作为稳定性度量,记为 $\mathcal{V}_{{\bm{\gamma}}|{\bm{\theta}}}$,以评估模型在分布偏移下的一致性。
  • 使用随机打乱基线对齐方差度量,实现不同模型和算法之间的相对比较,而无需解释绝对尺度。
  • 提出两阶段评估:第一阶段,利用影响函数方差判断是否需要OOD泛化;第二阶段,利用测试准确率对同一OOD类别内的模型进行排序。
  • 将该度量应用于真实世界基准数据集(如Colored MNIST、VLCS和PACS),并与ERM、IRM、Mixup和gDRO进行比较。
  • 证明影响函数方差越低,与高OOD准确率的相关性越强,即使测试准确率无法预测该结果。

实验结果

研究问题

  • RQ1在观测领域上的测试准确率能否可靠估计模型的真实OOD泛化性能?
  • RQ2是否存在一种模型无关的度量指标,可在目标领域集合未知的情况下检测是否需要OOD泛化?
  • RQ3影响函数方差与IRM惩罚项相比,作为OOD鲁棒性预测指标的表现如何?
  • RQ4影响函数方差能否帮助区分在未见领域上泛化良好的模型与仅在训练领域上过拟合的模型?
  • RQ5所提出的度量指标在超参数未最优调优的情况下,是否在多种算法和数据集上依然有效?

主要发现

  • 在观测领域上的测试准确率可能无法可靠反映OOD准确率,如在Colored MNIST中,ERM在测试领域上表现优于IRM,但IRM的OOD准确率显著更高。
  • 影响函数方差度量 $\mathcal{V}_{{\bm{\gamma}}|{\bm{\theta}}}$ 在多个数据集和算法中始终与OOD性能高度相关,值越低表示OOD泛化能力越强。
  • 在VLCS数据集中,gDRO的平均影响函数方差最高(5.17),表明其稳定性差,而ERM和Mixup的方差较低(分别为2.05和2.70),与它们更好的OOD性能一致。
  • IRM惩罚项作为选择指标表现不佳,因为其值可能很低,但OOD性能却很差(例如,在C领域,IRM惩罚项为2.59e-4,但OOD准确率仅为38.64%);而Mixup的惩罚项值虽高,但其OOD准确率与ERM相近。
  • 所提出的度量指标可在不依赖超参数调优的情况下实现可靠的模型选择,因其对惩罚项尺度不敏感,且在不同算法间具有鲁棒性。
  • 当 $\mathcal{E}_{all} \setminus \mathcal{E}_{tr} = \{S\}$ 时,gDRO的打乱版本 $\mathcal{V}_{{\bm{\gamma}}|{\bm{\theta}}}$ 显著小于标准版本,表明其捕捉的不变特征更少;而ERM和Mixup的两种版本差异极小,表明其具有更好的稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。