[论文解读] EnD: Entangling and Disentangling deep representations for bias correction
本文提出EnD,一种通过在神经网络某一层引入信息瓶颈,对同一目标类别特征进行特征纠缠、对共享相同偏见标签的特征进行解纠缠,从而校正深度神经网络偏差的正则化方法。该方法在不增加训练复杂度的前提下,提升了无偏测试集上的泛化性能,在IMDB和CORDA等具有偏见的数据集上实现了SOTA性能,适用于COVID-19胸部X光片分类任务。
Artificial neural networks perform state-of-the-art in an ever-growing number of tasks, and nowadays they are used to solve an incredibly large variety of tasks. There are problems, like the presence of biases in the training data, which question the generalization capability of these models. In this work we propose EnD, a regularization strategy whose aim is to prevent deep models from learning unwanted biases. In particular, we insert an "information bottleneck" at a certain point of the deep neural network, where we disentangle the information about the bias, still letting the useful information for the training task forward-propagating in the rest of the model. One big advantage of EnD is that we do not require additional training complexity (like decoders or extra layers in the model), since it is a regularizer directly applied on the trained model. Our experiments show that EnD effectively improves the generalization on unbiased test sets, and it can be effectively applied on real-case scenarios, like removing hidden biases in the COVID-19 detection from radiographic images.
研究动机与目标
- 解决因训练数据中隐藏偏差导致的模型泛化失败问题,尤其在医学影像等现实应用场景中。
- 开发一种正则化策略,校正偏差而不修改数据或向模型添加可学习组件。
- 通过抑制与数据来源或人口统计属性等偏差因素相关的虚假相关性,使深度模型能够学习与任务相关的特征。
- 在高度偏见的数据集和现实场景(如基于胸部X光片的COVID-19诊断)中验证方法的有效性。
- 提供一种事后、与模型无关的正则化技术,可在训练后应用以缓解偏差传播。
提出的方法
- 在已训练的深度神经网络特定层Γ应用正则化器,以构建信息瓶颈。
- 对来自同一目标类别样本的深层特征表示进行纠缠,以保留与任务相关的信息。
- 对共享相同偏见标签(如数据来源或年龄组)的样本的深层特征表示进行解纠缠,以抑制虚假相关性。
- 通过标准反向传播优化正则化器,无需额外训练或辅助模型。
- 利用正则化器最小化有偏特征与最终预测之间的互信息,偏好无偏表示。
- 在训练过程中将正则化器集成到损失函数中,使模型能够学习避免使用有偏特征,同时保持主任务性能。
实验结果
研究问题
- RQ1能否设计一种正则化器,在保留与任务相关表征的同时,解耦深度模型中的与偏差相关的特征?
- RQ2所提出的EnD方法是否能在不重新训练或修改数据的情况下,提升模型在无偏测试集上的泛化能力?
- RQ3当偏差未被明确知晓时(如医学影像中的数据来源或图像伪影),EnD在偏差校正方面的有效性如何?
- RQ4在现实世界中高度偏见的情境下,EnD是否能超越对抗训练或特征反演等现有去偏技术?
- RQ5EnD是否通过聚焦于相关解剖区域,使视觉模型(如Grad-CAM)的注意力图更加鲁棒和可解释?
主要发现
- 在IMDB Face数据集上,EnD将EB1测试集上的性别预测准确率从57.84%提升至69.40%,在EB2上的准确率从59.86%提升至65.49%(在EB1上训练),优于基线和先前方法。
- 在年龄预测任务中,EnD将EB1测试集上的性能从48.91%提升至74.25%(在EB2上训练),表明对基于性别的偏差具有显著缓解效果。
- 在CORDA-CDSS数据集上,EnD将真阴性率从59.26%提升至76.30%,平衡准确率从64.63%提升至72.22%,有效降低了数据来源偏差。
- 在CORDA-SLG数据集上,EnD将真正例率从52.14%提升至68.37%,平衡准确率从69.88%提升至75.94%,表现出更强的跨数据源鲁棒性。
- Grad-CAM可视化结果表明,EnD正则化模型聚焦于相关肺部区域,而原始模型则关注无关伪影,表明其可解释性得到改善。
- 与BlindEye和Kim et al. [16]等方法相比,EnD在高度偏见设置(如Biased MNIST和IMDB中的ρ = 0.999)下实现了SOTA性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。