[论文解读] On the Impact of Spurious Correlation for Out-of-distribution Detection
本文提出了一种分布外(OOD)检测的形式化方法,将不变特征(语义相关)与环境特征(虚假相关)区分开来,揭示了训练数据中虚假相关性的增强会严重降低OOD检测性能。研究识别出基于特征的检测方法在非虚假OOD检测中更为有效,并从理论上证明了虚假OOD输入可达到任意高的置信度,使得依赖环境特征的模型无法检测到它们。
Modern neural networks can assign high confidence to inputs drawn from outside the training distribution, posing threats to models in real-world deployments. While much research attention has been placed on designing new out-of-distribution (OOD) detection methods, the precise definition of OOD is often left in vagueness and falls short of the desired notion of OOD in reality. In this paper, we present a new formalization and model the data shifts by taking into account both the invariant and environmental (spurious) features. Under such formalization, we systematically investigate how spurious correlation in the training set impacts OOD detection. Our results suggest that the detection performance is severely worsened when the correlation between spurious features and labels is increased in the training set. We further show insights on detection methods that are more effective in reducing the impact of spurious correlation and provide theoretical analysis on why reliance on environmental features leads to high OOD detection error. Our work aims to facilitate a better understanding of OOD samples and their formalization, as well as the exploration of methods that enhance OOD detection.
研究动机与目标
- 为解决现实部署中OOD数据缺乏精确定义的问题,特别是涉及虚假相关性的数据分布偏移问题。
- 通过显式建模数据分布偏移中的不变特征与环境(虚假)特征,对OOD检测进行形式化。
- 研究训练数据中虚假相关性增强对虚假OOD与非虚假OOD输入检测性能的影响。
- 识别对虚假相关性更具鲁棒性的检测方法,并提供理论见解,解释为何依赖环境特征会导致高OOD误差。
- 倡导在标准基准之外,对虚假OOD样本评估OOD检测方法,以检验算法的鲁棒性。
提出的方法
- 提出一种新的OOD检测形式化方法,将不变特征(与语义标签相关)与环境特征(虚假、上下文依赖)分离。
- 定义两类OOD:虚假OOD(包含环境特征但无不变特征)与非虚假OOD(既不包含环境特征也不包含不变特征)。
- 以Waterbirds数据集和带有性别偏见的CelebA为案例研究,建模训练数据中的虚假相关性。
- 通过在虚假相关性逐步增强的条件下,对多种OOD检测方法进行广泛实验,比较其检测性能。
- 应用理论分析,证明依赖环境特征的模型可对虚假OOD输入赋予任意高的置信度,使其在标准OOD评估协议下无法被检测。
- 评估基于特征的OOD检测方法(如激活基于、表示基于)并与基于分数和生成式方法进行比较。
实验结果
研究问题
- RQ1训练集中环境特征与标签之间的虚假相关性增强,如何影响OOD检测性能?
- RQ2不同OOD检测方法在多大程度上缓解了虚假相关性的负面影响?
- RQ3为何即使模型训练时具有归纳偏差,对虚假OOD输入的检测仍具挑战性?
- RQ4理论分析能否解释存在置信度任意高的OOD输入,且这些输入可逃避检测?
- RQ5基于特征的方法在检测非虚假与虚假OOD输入方面,相较于基于分数或生成式方法表现如何?
主要发现
- 训练数据中的虚假相关性严重降低了对虚假OOD与非虚假OOD输入的检测性能,检测错误率随虚假相关性增强而上升。
- 基于特征的OOD检测方法在非虚假OOD数据上将FPR95降低了最多46.73%,表明其具有更强的鲁棒性。
- 依赖环境(虚假)特征的模型可对虚假OOD输入赋予任意高的置信度,使其在标准OOD评估协议下无法被检测。
- 理论分析证明,存在置信度可任意高的虚假OOD输入,当模型依赖非不变特征时,这些输入无法与分布内数据区分。
- 现有基准通常聚焦于非虚假OOD,但虚假OOD构成了一个关键且未被充分探索的挑战,严重威胁模型在现实部署中的可靠性。
- 本研究揭示,当前OOD检测评估方案不足,因其未能测试对语义无关但上下文相似输入(如带有水面背景的船)的检测能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。