[论文解读] Shape-Texture Debiased Neural Network Training
本文提出了一种形状-纹理去偏见神经网络训练方法,通过在训练数据中引入包含冲突形状与纹理线索的图像(例如,黑猩猩形状搭配柠檬纹理)并同时提供来自两种线索的联合监督,从而提升CNN的泛化能力和鲁棒性。该方法在ResNet-152上实现了ImageNet(+1.2% top-1准确率)、ImageNet-A(+5.2%)、ImageNet-C(+8.3%)、Stylized-ImageNet(+11.1%)以及FGSM对抗防御(+14.4%)的最先进性能,并与Mixup和CutMix兼容。
Shape and texture are two prominent and complementary cues for recognizing objects. Nonetheless, Convolutional Neural Networks are often biased towards either texture or shape, depending on the training dataset. Our ablation shows that such bias degenerates model performance. Motivated by this observation, we develop a simple algorithm for shape-texture debiased learning. To prevent models from exclusively attending on a single cue in representation learning, we augment training data with images with conflicting shape and texture information (eg, an image of chimpanzee shape but with lemon texture) and, most importantly, provide the corresponding supervisions from shape and texture simultaneously. Experiments show that our method successfully improves model performance on several image recognition benchmarks and adversarial robustness. For example, by training on ImageNet, it helps ResNet-152 achieve substantial improvements on ImageNet (+1.2%), ImageNet-A (+5.2%), ImageNet-C (+8.3%) and Stylized-ImageNet (+11.1%), and on defending against FGSM adversarial attacker on ImageNet (+14.4%). Our method also claims to be compatible with other advanced data augmentation strategies, eg, Mixup, and CutMix. The code is available here: https://github.com/LiYingwei/ShapeTextureDebiasedTraining.
研究动机与目标
- 为解决CNN在表示学习过程中对形状或纹理的固有偏好问题,该偏好会降低其在标准基准和鲁棒性基准上的性能。
- 探究结合形状与纹理表征是否能提升模型的泛化能力与对抗鲁棒性。
- 开发一种显式打破形状-纹理相关性的数据增强策略,同时保留双重监督信号。
- 证明该方法与现有先进数据增强技术(如Mixup和CutMix)的兼容性。
- 将去偏框架扩展至语义分割任务,展示其在图像分类之外的更广泛应用潜力。
提出的方法
- 通过在两个随机选择的图像之间应用风格迁移(使用AdaIN将一张图像的纹理迁移到另一张图像的形状上),生成具有线索冲突的图像。
- 通过组合两个源图像的真实标签,为每张线索冲突图像构建软标签,确保来自形状和纹理的双重监督。
- 使用结合形状与纹理监督的联合损失函数进行模型训练,防止模型过度依赖单一线索。
- 使用风格化系数(α=0.2)和形状-纹理系数(γ=0.95)在风格迁移过程中保留物体边界。
- 将该方法应用于图像分类与语义分割任务,针对分割任务的需求调整数据生成与标签组合方式。
- 将该方法与现有数据增强策略(如CutMix和Mixup)结合,展示其正交性增益。
实验结果
研究问题
- RQ1在包含冲突形状与纹理线索的图像上进行CNN训练,是否能提升其在标准与损坏图像基准上的泛化能力?
- RQ2在训练过程中对形状与纹理进行联合监督,是否能有效降低模型对某一类线索的偏好?
- RQ3与原始训练及其他数据增强技术相比,该方法在对抗攻击鲁棒性方面表现如何?
- RQ4该去偏框架能否扩展至语义分割等密集预测任务?
- RQ5该方法是否与现有先进数据增强策略(如CutMix和Mixup)兼容且具有互补性?
主要发现
- 使用该方法训练的ResNet-152在ImageNet上达到79.8%的top-1准确率,较基线模型绝对提升+1.2%。
- 去偏模型在ImageNet-A上提升+5.2%,在ImageNet-C上提升+8.3%,在Stylized-ImageNet上提升+11.1%。
- 在对抗鲁棒性方面,该方法使ImageNet上对FGSM攻击的干净准确率提升+14.4%。
- 与CutMix结合后,该方法进一步将CutMix-ResNeXt-101在ImageNet上的top-1准确率提升至81.2%,较基线提升+0.7%。
- 在语义分割任务中,该方法使DeepLabv3-ResNet-101达到77.6%的mIOU,较基线模型提升1.1%,较两倍训练周期的基线提升0.9%。
- 即使与更长的训练周期相比,该方法仍保持有效性,表明性能提升源于更优的表征学习,而非模型容量增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。