[论文解读] SelecMix: Debiased Learning by Contradicting-pair Sampling
SelecMix 提出了一种去偏学习方法,通过在矛盾对上使用 mixup——即相同标签但具有不相似偏置特征的样本,或不同标签但具有相似偏置特征的样本——来生成偏置冲突的训练样本。通过训练一个辅助对比模型以强调易于学习的偏置特征,SelecMix 无需显式偏置标签或解耦表示即可识别这些配对,在基准数据集上实现了最先进性能,尤其在标签噪声和低偏置冲突数据设置下表现优异。
Neural networks trained with ERM (empirical risk minimization) sometimes learn unintended decision rules, in particular when their training data is biased, i.e., when training labels are strongly correlated with undesirable features. To prevent a network from learning such features, recent methods augment training data such that examples displaying spurious correlations (i.e., bias-aligned examples) become a minority, whereas the other, bias-conflicting examples become prevalent. However, these approaches are sometimes difficult to train and scale to real-world data because they rely on generative models or disentangled representations. We propose an alternative based on mixup, a popular augmentation that creates convex combinations of training examples. Our method, coined SelecMix, applies mixup to contradicting pairs of examples, defined as showing either (i) the same label but dissimilar biased features, or (ii) different labels but similar biased features. Identifying such pairs requires comparing examples with respect to unknown biased features. For this, we utilize an auxiliary contrastive model with the popular heuristic that biased features are learned preferentially during training. Experiments on standard benchmarks demonstrate the effectiveness of the method, in particular when label noise complicates the identification of bias-conflicting examples.
研究动机与目标
- 为解决深度神经网络在训练数据存在偏置时学习到虚假相关性的问题,特别是当鲁棒特征代表性不足时。
- 开发一种数据增强方法,以生成有效的偏置冲突样本,而无需依赖复杂的生成模型或解耦表示。
- 通过选择性地使用矛盾对进行数据增强,提升模型在分布偏移和标签噪声下的泛化能力。
- 在标准去偏基准上验证该方法的有效性,尤其在偏置冲突样本稀缺的情况下。
提出的方法
- SelecMix 对矛盾对样本应用 mixup:(i) 标签相同但偏置特征不相似,或 (ii) 标签不同但偏置特征相似。
- 训练一个辅助对比模型,使用广义监督对比损失(GSC loss)以增强对偏置特征的依赖,从而实现对这些配对的识别。
- 利用辅助模型的嵌入空间来度量偏置特征的相似性,从而在无需显式偏置标签的情况下选择矛盾对。
- 对这些配对选择性地应用 mixup,采用对称加权策略,其中 λ 被设为 min(λ, 1−λ),以优先选择目标样本。
- 去偏模型与辅助模型联合训练,利用增强后的数据提升模型鲁棒性。
- 该方法通过在 mixup 中频繁选择现有偏置冲突样本,实现对这些样本的隐式加权,从而增强其影响,而无需显式重加权。
实验结果
研究问题
- RQ1能否有效适配 mixup 以生成偏置冲突样本,而无需显式偏置标签或解耦表示?
- RQ2基于矛盾对的选择性 mixup 策略与标准 mixup 及其他数据增强基线相比,在去偏任务中表现如何?
- RQ3具有 GSC 损失的辅助对比模型在提升偏置特征相似性度量以用于配对选择方面,改善程度如何?
- RQ4SelecMix 对标签噪声的鲁棒性如何,因为标签噪声会增加真实偏置冲突样本检测的难度?
- RQ5当训练数据中偏置冲突样本稀少时,SelecMix 是否仍能保持优越性能?
主要发现
- SelecMix 在标准去偏基准上优于先前方法,在 Colored MNIST 数据集上,偏置比例为 0.5% 时达到 70.80% 的准确率,显著优于原始 mixup 的 58.07%。
- 在 BFFHQ 数据集上,偏置比例为 0.5% 时,SelecMix 达到 77.40% 的准确率,显著优于 LISA(58.93%)和原始 mixup(56.20%)。
- 在标签噪声存在的情况下,SelecMix 仍保持强大性能,表现出优异的鲁棒性,而其他方法则明显退化。
- 消融实验确认,选择性 mixup 策略和 GSC 损失均至关重要,其中后者显著提升了偏置特征相似性的度量能力。
- 在 Corrupted CIFAR-10 数据集上,偏置比例为 5% 时,SelecMix 达到 91.57% 的准确率,优于 LISA(88.73%)和原始 mixup(82.12%)。
- 该方法在所有测试数据集和偏置比例下均表现出一致的性能提升,尤其在偏置冲突样本稀少时更为显著,表明实现了有效的隐式加权。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。