[论文解读] Removing Undesirable Feature Contributions Using Out-of-Distribution Data
本文提出分布外数据增强训练(OAT),一种通过利用分布外(OOD)数据而不依赖无标签分布内(UID)数据或伪标签,来提升深度神经网络在标准训练和对抗训练中泛化能力的方法。通过为OOD样本分配统一标签,OAT抑制了不良特征学习,即使与现有数据增强技术结合,也能实现最先进性能提升。
Several data augmentation methods deploy unlabeled-in-distribution (UID) data to bridge the gap between the training and inference of neural networks. However, these methods have clear limitations in terms of availability of UID data and dependence of algorithms on pseudo-labels. Herein, we propose a data augmentation method to improve generalization in both adversarial and standard learning by using out-of-distribution (OOD) data that are devoid of the abovementioned issues. We show how to improve generalization theoretically using OOD data in each learning scenario and complement our theoretical analysis with experiments on CIFAR-10, CIFAR-100, and a subset of ImageNet. The results indicate that undesirable features are shared even among image data that seem to have little correlation from a human point of view. We also present the advantages of the proposed method through comparison with other data augmentation methods, which can be used in the absence of UID data. Furthermore, we demonstrate that the proposed method can further improve the existing state-of-the-art adversarial training.
研究动机与目标
- 解决现有数据增强方法依赖难以获取的无标签分布内(UID)数据和不准确伪标签的局限性。
- 探究是否可利用分布外(OOD)数据来提升标准学习和对抗学习中的泛化能力。
- 开发一种理论基础扎实、简单易行的方法,无需利用OOD数据的标签信息即可消除不良特征贡献。
- 通过实证验证,不良特征在不同图像数据集间可迁移,即使从人类视角看它们似乎无关。
- 证明OAT可进一步提升现有最先进对抗训练方法的性能。
提出的方法
- 提出分布外数据增强训练(OAT),一种利用带有统一标签的OOD样本进行正则化训练的数据增强方法。
- 理论分析表明,当OOD数据与分布内数据共享不良特征时,可减少此类特征在分类器权重更新中的影响。
- 在每个训练批次中,OAT将分布内数据与OOD数据结合,其中OOD样本被赋予所有类别上的均匀分布标签。
- 该方法假设OOD数据与分布内数据共享不良特征空间,从而实现抑制对这些特征依赖的正则化。
- OAT在标准训练和对抗训练设置中均适用,且不使用OOD标签或伪标签。
- 该方法实现简单,可与现有增强技术(如Mixup)结合使用。
实验结果
研究问题
- RQ1是否可利用分布外(OOD)数据在不依赖伪标签或无标签分布内(UID)数据的情况下,提升深度神经网络的泛化能力?
- RQ2不良特征(如非鲁棒、虚假相关性)在看似无关的不同图像数据集之间可迁移程度如何,即使它们从人类视角看无关?
- RQ3当UID数据不可用时,OAT与现有数据增强方法相比在性能提升方面表现如何?
- RQ4OAT是否可进一步提升已使用UID数据的最先进对抗训练方法?
- RQ5OAT的有效性是否依赖于OOD数据与分布内数据之间的分布相似性?
主要发现
- OAT在CIFAR-10和CIFAR-100上显著提升泛化性能,尤其在训练数据有限时:例如,使用80M-TI数据的OAT在仅2,500个训练样本下,CIFAR-10标准准确率达到72.49%,优于基线的65.44%。
- 在ImageNet-10(64×64)上,使用Places365数据的OAT在仅100个训练样本下达到41.84%的标准准确率,优于基线的37.90%。
- 与伪标签结合时,OAT进一步提升性能:融合模型在CIFAR-10上达到95.53%测试准确率,在CIFAR-100上达到77.36%,超过伪标签基线的95.28%和77.24%。
- 当OOD数据与目标数据共享相同的不良特征分布时,OAT效果最佳;与80M-TI和Places365相比,SVHN等分布差异较大的OOD数据集带来的增益较弱。
- OAT在对抗训练中比在标准训练中更有效,表明不良特征在对抗设置下更具可迁移性。
- OAT可增强现有方法(如Mixup),证明其与现有训练流程兼容,并具备集成潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。