[论文解读] Latent Adversarial Debiasing: Mitigating Collider Bias in Deep Neural Networks
本文提出潜在对抗去偏(Latent Adversarial Debiasing, LAD),通过在VQ-VAE的潜在空间中生成对抗样本,以解耦易于学习的混淆信号与因果信号,从而缓解深度神经网络中的碰撞偏差。LAD在无标签去偏任务中达到最先进性能,在背景着色MNIST上提升测试准确率76.12%,在前景着色MNIST上提升35.47%,在损坏的CIFAR-10上提升8.27%,即使训练数据100%存在偏差亦能实现。
Collider bias is a harmful form of sample selection bias that neural networks are ill-equipped to handle. This bias manifests itself when the underlying causal signal is strongly correlated with other confounding signals due to the training data collection procedure. In the situation where the confounding signal is easy-to-learn, deep neural networks will latch onto this and the resulting model will generalise poorly to in-the-wild test scenarios. We argue herein that the cause of failure is a combination of the deep structure of neural networks and the greedy gradient-driven learning process used - one that prefers easy-to-compute signals when available. We show it is possible to mitigate against this by generating bias-decoupled training data using latent adversarial debiasing (LAD), even when the confounding signal is present in 100% of the training data. By training neural networks on these adversarial examples,we can improve their generalisation in collider bias settings. Experiments show state-of-the-art performance of LAD in label-free debiasing with gains of 76.12% on background coloured MNIST, 35.47% on fore-ground coloured MNIST, and 8.27% on corrupted CIFAR-10.
研究动机与目标
- 解决碰撞偏差问题,即由于数据收集方式导致混淆信号占主导地位的普遍样本选择偏差。
- 克服深度神经网络在基于梯度的贪婪学习过程中倾向于利用易于学习的混淆信号而非更难的因果信号的倾向。
- 开发一种无需访问无偏训练数据的无标签去偏方法,以实现真实场景部署中的鲁棒性。
- 证明潜在空间中的对抗扰动可有效解耦混淆信号与因果信号,从而提升泛化能力。
- 在具有逐步增强的偏差与真实信号纠缠程度的基准数据集上验证该方法。
提出的方法
- 利用VQ-VAE建模数据流形,实现潜在空间中因果信号与混淆信号的分离。
- 在潜在空间中应用基于梯度的对抗扰动,生成减少对混淆特征依赖的去偏样本。
- 采用潜在对抗行走策略扰动表征,使混淆信号与分类目标解耦。
- 将扰动后的潜在码重构回图像空间,生成具有缓解碰撞偏差的增强训练数据。
- 在对抗增强数据上训练分类器,迫使模型依赖因果信号而非虚假相关性。
- 采用基于梯度的优化策略,确保扰动聚焦于最显著、最易学习的混淆特征。
实验结果
研究问题
- RQ1潜在空间中的对抗样本能否有效解耦深度神经网络中的混淆信号与因果信号?
- RQ2所提出的LAD方法是否能在不使用任何无偏样本的情况下,于100%有偏训练数据中提升模型泛化能力?
- RQ3在强碰撞偏差条件下,LAD与以往最先进方法在无标签去偏任务中的表现相比如何?
- RQ4LAD在去除虚假相关性的同时,能在多大程度上保持数据的真实语义内容?
- RQ5LAD能否泛化至高度纠缠且不可逆的损坏类型,如JPEG压缩或像素化?
主要发现
- 与基线模型相比,LAD在背景着色MNIST上的测试准确率提升76.12%,展现出强大的去偏性能。
- 在前景着色MNIST上,LAD实现35.47%的准确率增益,表明即使偏差叠加在物体上而非背景,方法依然有效。
- 在损坏的CIFAR-10上,LAD在存在JPEG压缩和像素化等不可逆损坏的情况下,仍使测试准确率提升8.27%。
- 该方法优于以往最先进方法,包括需要95%无偏数据比例才能达到相近效果的LfF,而LAD在100%有偏数据上即表现优异。
- LAD的重建结果较好地保留了语义内容,但在高度纠缠情况下(如损坏CIFAR-10中的模糊数字)仍出现部分伪影。
- 当混淆信号与类别标签高度相关且难以逆转时,该方法依然有效,表明其对不可逆数据失真具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。