[论文解读] Learning Not to Learn: Training Deep Neural Networks with Biased Data
本文提出了一种新颖的正则化方法,通过最小化深度特征嵌入与目标数据偏差之间的互信息,以消除训练数据中的虚假相关性。通过对抗性地训练判别器以从特征中预测偏差,主网络学习到对偏差不变的表示,显著提升了在具有先前未见偏差分布的测试数据上的泛化能力。
We propose a novel regularization algorithm to train deep neural networks, in which data at training time is severely biased. Since a neural network efficiently learns data distribution, a network is likely to learn the bias information to categorize input data. It leads to poor performance at test time, if the bias is, in fact, irrelevant to the categorization. In this paper, we formulate a regularization loss based on mutual information between feature embedding and bias. Based on the idea of minimizing this mutual information, we propose an iterative algorithm to unlearn the bias information. We employ an additional network to predict the bias distribution and train the network adversarially against the feature embedding network. At the end of learning, the bias prediction network is not able to predict the bias not because it is poorly trained, but because the feature embedding network successfully unlearns the bias information. We also demonstrate quantitative and qualitative experimental results which show that our algorithm effectively removes the bias information from feature embedding.
研究动机与目标
- 解决深度神经网络从有偏见的训练数据中学习虚假相关性的问题,这会损害在具有不同偏差分布的测试数据上的泛化能力。
- 开发一种正则化技术,显式最小化学习到的特征嵌入与目标数据偏差之间的互信息。
- 使深度网络能够在不依赖无偏见训练数据的情况下,学习到解耦的、对偏差不变的表示。
- 证明从特征中去除偏差信息可提升模型性能和鲁棒性,甚至超越在近乎无偏见数据上训练的模型。
提出的方法
- 基于特征嵌入与目标偏差之间互信息的正则化损失,以促进解耦。
- 对抗性地训练一个辅助偏差预测网络,以最大化其从特征中预测偏差的能力,与主特征编码器对抗。
- 在极小化-极大化博弈设置下,优化主网络以最小化分类损失和与预测偏差的互信息。
- 采用迭代训练,使主网络学习到对目标偏差不变的表示,同时保持高分类准确率。
- 引入偏差植入协议,在公开数据集上创建受控的有偏训练集,以评估偏差消除效果。
- 将该方法应用于图像分类任务,以颜色、年龄和性别为目标偏差,使用真实世界数据集如 EMNIST、dogs vs. cats 和 IMDB face。
实验结果
研究问题
- RQ1在深度神经网络中,特征与目标偏差之间互信息的最小化是否能有效消除虚假相关性?
- RQ2与偏差预测器对抗训练是否能产生更鲁棒、对偏差不变的特征表示?
- RQ3即使测试数据的偏差分布与训练数据不同,从特征中去除偏差信息是否仍能提升泛化性能?
- RQ4所提出方法的性能与基线模型及在近乎无偏见数据上训练的模型相比如何?
- RQ5当偏差与目标标签独立(如颜色)与相关(如年龄和性别)时,该方法在多大程度上提升了性能?
主要发现
- 在带有颜色偏差的 EMNIST 数据集上,所提方法实现了 86.66% 的测试准确率,优于基线(84.42%)和 BlindEye(85.56%),表现出显著提升。
- 在 dogs vs. cats 数据集上,该模型成功忽略了测试图像中的颜色偏差,堆叠条形图显示预测结果与颜色无关,而基线模型则表现出依赖性。
- 在 IMDB face 数据集上,该方法减少了年龄偏差对性别分类的影响,预测结果与年龄无关,如定性结果所示。
- 在大多数实验中,该模型的表现优于 'Gray' 基线(在近乎无偏见数据上训练),表明偏差消除可增强特征的判别性。
- 当偏差与目标标签无关时(如数字分类中的颜色),性能提升最为显著,表明当偏差真正无关时,去偏最有效。
- 在偏差与标签相关的情况下(如年龄和性别),性能提升有限,表明去偏并非在所有情况下都有益,其效果取决于数据结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。