[论文解读] Between-class Learning for Image Classification
本文提出了用于图像分类的类间(Between-Class, BC)学习方法,模型通过预测来自不同类别的两张图像的混合比例进行训练。通过将图像视为波形并应用简单或能量感知的混合方式,BC学习提升了模型的泛化能力,将ImageNet-1K的top-1错误率降低至19.4%,CIFAR-10错误率降低至2.26%。
In this paper, we propose a novel learning method for image classification called Between-Class learning (BC learning). We generate between-class images by mixing two images belonging to different classes with a random ratio. We then input the mixed image to the model and train the model to output the mixing ratio. BC learning has the ability to impose constraints on the shape of the feature distributions, and thus the generalization ability is improved. BC learning is originally a method developed for sounds, which can be digitally mixed. Mixing two image data does not appear to make sense; however, we argue that because convolutional neural networks have an aspect of treating input data as waveforms, what works on sounds must also work on images. First, we propose a simple mixing method using internal divisions, which surprisingly proves to significantly improve performance. Second, we propose a mixing method that treats the images as waveforms, which leads to a further improvement in performance. As a result, we achieved 19.4% and 2.26% top-1 errors on ImageNet-1K and CIFAR-10, respectively.
研究动机与目标
- 将原本用于声音识别的类间学习方法拓展至图像分类任务。
- 探究尽管存在视觉不连贯性,跨类别图像混合是否能够提升模型的泛化能力。
- 探索卷积神经网络(CNN)是否隐式将图像视为波形,从而支持基于混合的训练方法。
- 设计一种简单但有效的混合策略,以增强特征分布的约束。
- 通过实证验证BC学习在多种架构和数据集上的性能,证明其具有稳定且一致的性能提升。
提出的方法
- 通过随机混合比例将来自不同类别的两张图像组合,生成混合图像。
- 使用回归头训练模型回归混合比例,引入新的比例预测头。
- 采用基于内部划分的简单混合方法(如空间裁剪与融合)生成混合输入。
- 提出BC+方法:将图像视为零均值波形,即在混合前减去每张图像的均值,并按图像能量进行归一化。
- 对输入和监督信号使用相同的混合比例,实现端到端训练,仅使用单一损失函数。
- 引入多类别混合策略,使模型即使在混合中包含多个类别时,也能学习预测混合比例。
实验结果
研究问题
- RQ1尽管存在视觉不连贯性,类间学习在声音识别中表现良好,是否能成功应用于图像分类?
- RQ2将图像视为波形是否能实现有意义的数据混合,从而提升模型泛化能力?
- RQ3混合位置的选择(例如输入层与特征层)如何影响模型性能?
- RQ4为最大化性能,混合的最优类别数量是多少(例如两类 vs 三类)?
- RQ5BC学习是否对特征分布施加了结构化约束,从而带来更好的泛化性能?
主要发现
- 在ResNeXt-101 (64×4d) 模型上,BC学习将ImageNet-1K的top-1错误率从20.4%降低至19.4%。
- 改进后的BC+方法在使用Shake-Shake正则化的模型上,将CIFAR-10错误率从2.86%降低至2.26%。
- 消融实验表明,混合来自不同类别的两张图像(N=2)的性能始终优于随机混合或同类别图像混合。
- 在输入层进行混合可获得最佳性能,而在深层网络层(如pool2)进行混合则导致性能下降。
- 通过三维PCA进行的特征可视化表明,BC学习生成的特征分布更加球形且紧密聚集,类内方差显著降低。
- 该方法在多种架构上均实现了稳定提升,包括简单的11层CNN和当前最先进的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。