[论文解读] OoD-Bench: Quantifying and Understanding Two Dimensions of Out-of-Distribution Generalization
本文提出了 OoD-Bench,一个用于量化分布外(OoD)泛化中两种不同类型的分布偏移——多样性偏移和相关性偏移——的框架。通过在每种偏移主导的基准上评估现有的 OoO 算法,作者发现大多数方法仅在一种类型的偏移上表现优异,暴露了当前方法的关键局限性,并呼吁开展更具平衡性的评估与基于偏移特征刻画的算法设计。
Deep learning has achieved tremendous success with independent and identically distributed (i.i.d.) data. However, the performance of neural networks often degenerates drastically when encountering out-of-distribution (OoD) data, i.e., when training and test data are sampled from different distributions. While a plethora of algorithms have been proposed for OoD generalization, our understanding of the data used to train and evaluate these algorithms remains stagnant. In this work, we first identify and measure two distinct kinds of distribution shifts that are ubiquitous in various datasets. Next, through extensive experiments, we compare OoD generalization algorithms across two groups of benchmarks, each dominated by one of the distribution shifts, revealing their strengths on one shift as well as limitations on the other shift. Overall, we position existing datasets and algorithms from different research areas seemingly unconnected into the same coherent picture. It may serve as a foothold that can be resorted to by future OoD generalization research. Our code is available at https://github.com/ynysjtu/ood_bench.
研究动机与目标
- 识别并量化 OoD 数据集中常见的两种不同类型分布偏移——多样性偏移与相关性偏移。
- 在每种偏移主导的基准上评估现有 OoD 泛化算法的性能。
- 解释为何近期的 OoD 算法在实践中往往表现不优于 ERM,尽管其声称具有优越性。
- 提供一个统一框架,以理解领域自适应、因果推断与稳定学习等不同领域中 OoD 研究的差异。
- 建议在未来 OoD 研究中对两种偏移类型进行全面评估,并改进数据集设计。
提出的方法
- 作者将多样性偏移定义为潜在环境分布支持集之间的差异,将相关性偏移定义为在相同支持集上概率密度函数的差异。
- 他们提出一种方法,通过潜在空间分析与分布比较,来估计任意标注数据集中每种偏移的强度。
- 在两组基准上进行了大量实验:一组以多样性偏移为主(如 VLCS、PACS),另一组以相关性偏移为主(如 ImageNet-V2)。
- 在两种设置下评估算法,以比较其相对性能并识别其优劣势。
- 该框架将领域自适应、因果推断与稳定学习等不同研究领域的发现整合为对 OoD 偏移的统一理解。
- 对所有算法标准化了超参数搜索空间,以确保公平比较,并在附录表格中提供了默认值与分布。
实验结果
研究问题
- RQ1如何对 OoD 数据集中的分布偏移进行定量测量与分类?
- RQ2为何许多先进的 OoD 泛化算法在实践中表现与 ERM 相当?
- RQ3现有 OoD 算法在不同类型的分布偏移上是否表现出一致的性能?
- RQ4多样性偏移与相关性偏移在模型泛化能力上的影响有何不同?
- RQ5这些发现对未来 OoD 基准设计与算法开发有何启示?
主要发现
- 在以多样性偏移为主的数据集(如 VLCS、PACS)上,CORAL、SagNet 和 RSC 等算法的表现优于或等同于 ERM,与先前研究一致。
- 在表现出主导性相关性偏移的 ImageNet-V2 上,ERM 的表现优于所有其他 OoD 算法,且性能排名与多样性偏移基准完全相反。
- ERM 与先进 OoD 方法之间的性能差距并非源于算法本身的缺陷,而是由于评估基准中偏移类型不匹配所致。
- 大多数 OoD 算法仅对一种类型的偏移有效,表明其在多样性与相关性偏移之间缺乏鲁棒性。
- 本研究揭示,当前基准与算法在偏移类型上并未得到统一评估,导致对算法进展的高估。
- 作者建议设计能微妙捕捉现实世界偏移的新基准,并在多样性偏移与相关性偏移数据集上同时评估算法,以确保全面评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。