[论文解读] Multi-Label Image Classification with Contrastive Learning
本文提出 MulCon,一种用于多标签图像分类的新型对比学习框架,通过多头注意力机制学习特定于标签的图像表征,从而实现每个标签的有效正样本/负样本定义。通过结合二元交叉熵损失与监督对比损失的两阶段训练策略,MulCon 在 COCO 和 NUS-WIDE 数据集上实现了最先进性能。
Recently, as an effective way of learning latent representations, contrastive learning has been increasingly popular and successful in various domains. The success of constrastive learning in single-label classifications motivates us to leverage this learning framework to enhance distinctiveness for better performance in multi-label image classification. In this paper, we show that a direct application of contrastive learning can hardly improve in multi-label cases. Accordingly, we propose a novel framework for multi-label classification with contrastive learning in a fully supervised setting, which learns multiple representations of an image under the context of different labels. This facilities a simple yet intuitive adaption of contrastive learning into our model to boost its performance in multi-label image classification. Extensive experiments on two benchmark datasets show that the proposed framework achieves state-of-the-art performance in the comparison with the advanced methods in multi-label classification.
研究动机与目标
- 为解决将对比学习应用于多标签图像分类时的挑战,即标准图像级表征因存在多个标签而难以定义有意义的正样本/负样本。
- 设计一种能够学习到区分性、标签感知的图像表征的框架,以提升多标签场景下的特征判别能力。
- 通过注意力机制将图像分解为特定于标签的组件,实现在多标签场景中应用监督对比学习。
- 通过实证验证,当采用分阶段训练策略时,对比学习可有效提升多标签分类性能。
提出的方法
- 通过将全局类别特定嵌入与局部 CNN 特征结合,并应用多头注意力机制,生成每个标签特定的表征。
- 将同一小批量中具有相同标签的其他图像定义为标签级嵌入的正样本,未包含该标签的图像则作为负样本。
- 在标签级嵌入上应用监督对比损失(SCL),以在嵌入空间中拉近正样本、推开负样本。
- 采用两阶段训练流程:首先使用二元交叉熵损失在标签级嵌入上进行预训练,然后使用 BCE 和 SCL 损失进行微调。
- 采用双分支网络架构,其中图像编码器处理输入图像,标签级嵌入头通过注意力机制生成每个标签的表征。
- 利用对比损失增强同一标签下不同图像之间表征的一致性与连贯性,从而提升下游分类性能。
实验结果
研究问题
- RQ1对比学习能否在多标签图像分类中有效应用,其中标准图像级表征使得正样本/负样本的定义变得模糊?
- RQ2学习特定于标签的图像表征是否能提升多标签场景下的特征判别能力与分类准确率?
- RQ3何种训练策略可使对比学习在不破坏多标签任务中标签相关性学习的前提下提升性能?
- RQ4标签级嵌入与图像级表征相比,在捕捉与单个标签相关语义内容方面表现如何?
主要发现
- MulCon 在 MS-COCO 和 NUS-WIDE 数据集上实现了最先进性能,优于现有方法。
- 消融实验表明,仅使用标签级嵌入网络即可将 mAP 从 80.8 提升至 83.0,证明其有效性。
- 直接在图像级特征上应用 SCL 仅带来微小增益(mAP 从 80.8 提升至 81.0),表明在标准多标签设置中收益有限。
- 从训练初期就应用 SCL 会降低性能(mAP 为 81.1),表明早期对比学习可能过度强调表征的区分性,而损害了标签相关性学习。
- 两阶段训练策略——先使用 BCE 预训练,再使用 BCE+SCL 微调——取得了最佳性能,证实该策略的必要性。
- 定性结果表明,注意力图能正确地定位与真实标签对应的物体,且使用标签级嵌入进行图像检索可返回语义相关的图像。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。