[论文解读] Class Rectification Hard Mining for Imbalanced Deep Learning
该论文提出了一种新颖的端到端深度学习框架——类别校正损失(Class Rectification Loss, CRL),用于在极端类别不平衡条件下进行多标签人物属性识别。通过在每个批次中进行增量式难样本挖掘(针对少数类的正样本和负样本),并应用CRL正则化损失,模型显著提升了对罕见属性的学习能力,在高度不平衡的X-Domain数据集上比SOTA方法平均准确率高出4%,在CelebA数据集上高出2%,且训练速度提升三倍以上。
Recognising detailed facial or clothing attributes in images of people is a challenging task for computer vision, especially when the training data are both in very large scale and extremely imbalanced among different attribute classes. To address this problem, we formulate a novel scheme for batch incremental hard sample mining of minority attribute classes from imbalanced large scale training data. We develop an end-to-end deep learning framework capable of avoiding the dominant effect of majority classes by discovering sparsely sampled boundaries of minority classes. This is made possible by introducing a Class Rectification Loss (CRL) regularising algorithm. We demonstrate the advantages and scalability of CRL over existing state-of-the-art attribute recognition and imbalanced data learning models on two large scale imbalanced benchmark datasets, the CelebA facial attribute dataset and the X-Domain clothing attribute dataset.
研究动机与目标
- 解决大规模网络收集图像数据集中人物属性识别面临的极端类别不平衡问题。
- 克服现有方法(如过采样、欠采样和代价敏感学习)存在的过拟合或数据丢失等局限性。
- 开发一种端到端的深度学习框架,明确提升少数属性类别表征学习能力,且不依赖手工设计特征。
- 通过在每个训练批次中聚焦少数类的难样本,实现在大规模不平衡数据集上的可扩展、增量式学习。
- 在X-Domain和CelebA等高度不平衡基准数据集上,超越现有SOTA模型的准确率和训练效率。
提出的方法
- 该方法采用批次内增量式难样本挖掘,在每次训练迭代中仅聚焦于少数类属性的难正样本和难负样本。
- 提出一种新型类别校正损失(CRL),通过显式对齐特征表示与少数类边界的机制,正则化模型优化过程。
- CRL采用实例级难样本挖掘,基于特征间距选择每个批次中最困难的样本,从而提升对罕见属性的泛化能力。
- 损失函数设计与数据集总体规模无关,可扩展至超大规模不平衡数据集。
- 框架以端到端方式联合学习特征表示与多标签分类,避免特征与分类器的分离优化。
- 模型采用多分支网络架构,共享卷积层,并为每个属性设置独立的全连接分支,实现多任务学习。
实验结果
研究问题
- RQ1在高度不平衡的人物属性数据集中,对少数类样本进行批次内增量式难样本挖掘是否能提升深度学习性能?
- RQ2所提出的类别校正损失(CRL)与现有损失函数及数据重采样策略相比,在缓解对多数类的偏见方面表现如何?
- RQ3CRL框架在极大规模、极端不平衡的数据集(如X-Domain,类别不平衡比高达1:4,162)上是否具备良好的可扩展性?
- RQ4实例级难样本挖掘是否优于类别级难样本挖掘,从而更有效地提升少数类识别准确率?
- RQ5在基准数据集上,CRL模型与SOTA模型(如LMLE和MTCT)相比,在性能和训练速度方面表现如何?
主要发现
- 采用实例级难样本挖掘与相对损失的CRL(I)变体在X-Domain数据集上相比基线模型MTCT实现了6.13%的平均准确率提升。
- 在X-Domain基准上,CRL(I)比SOTA模型LMLE高出4%的平均准确率,表明其在高度不平衡数据上的显著优越性。
- 在CelebA数据集上,CRL(I)相比基线模型实现5.85%的准确率增益,且在更不平衡的属性上性能差距进一步扩大。
- CRL(C)与CRL(I)在高度不平衡的“袖口形状”属性上分别实现8%和7%的准确率增益,优于LMLE的2%增益。
- 尽管性能更优,CRL模型的训练速度比LMLE模型快三倍以上,表明其具有极高的训练效率。
- 实例级难样本挖掘与相对损失的结合(CRL(I+R))取得最佳效果,在X-Domain上实现6.13%的增益,在CelebA上实现5.85%的增益,证实其在极端不平衡条件下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。