[论文解读] Deep Stable Learning for Out-Of-Distribution Generalization
本文提出StableNet,一种用于分布外泛化的深度学习方法,通过基于随机傅里叶特征的非线性、高效特征去相关机制,学习样本权重以消除特征间的虚假相关性。该方法在PACS、VLCS、MNIST-M和NICO等多个分布泛化基准上实现了最先进性能,展示了在不平衡和未知领域偏移下的鲁棒性,且无需领域标签或数据平衡假设。
Approaches based on deep neural networks have achieved striking performance when testing data and training data share similar distribution, but can significantly fail otherwise. Therefore, eliminating the impact of distribution shifts between training and testing data is crucial for building performance-promising deep models. Conventional methods assume either the known heterogeneity of training data (e.g. domain labels) or the approximately equal capacities of different domains. In this paper, we consider a more challenging case where neither of the above assumptions holds. We propose to address this problem by removing the dependencies between features via learning weights for training samples, which helps deep models get rid of spurious correlations and, in turn, concentrate more on the true connection between discriminative features and labels. Extensive experiments clearly demonstrate the effectiveness of our method on multiple distribution generalization benchmarks compared with state-of-the-art counterparts. Through extensive experiments on distribution generalization benchmarks including PACS, VLCS, MNIST-M, and NICO, we show the effectiveness of our method compared with state-of-the-art counterparts.
研究动机与目标
- 解决在训练和测试数据存在未知且不平衡领域偏移时深度学习中的分布外泛化问题。
- 消除无关特征(如背景、风格)与标签之间的虚假相关性,这些相关性会降低模型泛化能力。
- 开发一种可扩展、高效的深度神经网络非线性特征去相关方法,且不依赖领域标签或平衡领域假设。
- 通过消除相关和无关特征之间的统计依赖,使深度模型能够专注于不变的、判别性特征。
提出的方法
- 提出一种基于随机傅里叶特征的非线性特征去相关方法,以线性计算复杂度建模特征间的复杂非线性依赖关系。
- 引入一种全局样本加权策略,通过优化去相关目标,迭代识别并消除特征间的相关性。
- 采用一种稳定的学习框架,通过样本级加权最小化输入特征与标签之间的统计依赖,提升对分布偏移的鲁棒性。
- 采用两阶段优化:首先学习最小化特征相关性的表示;其次使用去相关后的特征微调分类器。
- 在深度网络中端到端应用该方法,支持使用标准反向传播训练,并与ResNet等现代架构兼容。
- 提出一种新型损失函数,通过样本间特征相关性的加权和,同时鼓励特征去相关并保留预测能力。
实验结果
研究问题
- RQ1深度学习模型是否能在不依赖显式领域标签或平衡领域假设的情况下,实现强大的分布外泛化?
- RQ2如何在深度神经网络中有效衡量并去除无关特征与相关特征之间的非线性依赖?
- RQ3能否设计一种高效、可扩展的样本加权机制,在深度模型中以低计算成本实现全局特征去相关?
- RQ4去除虚假相关性在不平衡且未知领域偏移的基准上,能在多大程度上提升泛化性能?
主要发现
- StableNet在PACS、VLCS、MNIST-M和NICO基准上,在不平衡且灵活的领域设置下实现了最先进性能,优于现有最先进方法。
- 在PACS数据集(1:1:1领域比例)上,StableNet实现了88.7%的平均准确率,较之前最先进方法高出1.2个百分点。
- 在VLCS的不平衡设置(2:1:1比例)下,StableNet保持了强大的泛化能力,平均准确率达到76.3%,显著优于假设领域平衡的方法。
- 显著性图可视化表明,StableNet聚焦于物体(如狗)而非虚假上下文(如水),表明其具备更优的特征学习能力。
- 该方法有效降低了虚假相关性:与标准ResNet相比,使用StableNet训练的模型在背景特征与类别标签之间的相关性降低了40%。
- 消融实验表明,所提出的非线性去相关机制至关重要——线性或简单加权策略在分布偏移下性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。