[论文解读] MlTr: Multi-label Classification with Transformer
本文提出 MlTr,一种基于 Transformer 的新型架构,用于多标签图像分类,解决了 CNN 在小物体、相似物体以及共现物体依赖关系方面的局限性。通过整合窗口划分、窗口内像素注意力和跨窗口注意力,MlTr 在 MS-COCO 上实现 88.5% 的 mAP,Pascal-VOC 上为 95.8%,NUS-WIDE 上为 66.3%,达到当前最先进性能。
The task of multi-label image classification is to recognize all the object labels presented in an image. Though advancing for years, small objects, similar objects and objects with high conditional probability are still the main bottlenecks of previous convolutional neural network(CNN) based models, limited by convolutional kernels' representational capacity. Recent vision transformer networks utilize the self-attention mechanism to extract the feature of pixel granularity, which expresses richer local semantic information, while is insufficient for mining global spatial dependence. In this paper, we point out the three crucial problems that CNN-based methods encounter and explore the possibility of conducting specific transformer modules to settle them. We put forward a Multi-label Transformer architecture(MlTr) constructed with windows partitioning, in-window pixel attention, cross-window attention, particularly improving the performance of multi-label image classification tasks. The proposed MlTr shows state-of-the-art results on various prevalent multi-label datasets such as MS-COCO, Pascal-VOC, and NUS-WIDE with 88.5%, 95.8%, and 65.5% respectively. The code will be available soon at https://github.com/starmemda/MlTr/
研究动机与目标
- 识别并解决多标签图像分类中的三个关键挑战:小物体识别、相似物体混淆以及因频繁共现导致的误分类。
- 克服 CNN 在多标签设置中固有的归纳偏置和长距离依赖学习能力有限的问题。
- 设计一种专为多标签任务量身定制的 Transformer 架构,以提升全局与局部特征表示能力。
- 提出一种新型注意力机制——跨窗口注意力,以增强局部区域之间的空间依赖建模能力。
- 通过引入物体感知标记和优化的损失函数(包括弧 Sigmoid),提升模型泛化能力。
提出的方法
- 将输入图像划分为非重叠窗口,以实现局部计算,同时保持空间结构。
- 在每个窗口内应用窗口内自注意力机制,以捕捉细粒度的像素级表征并精确定位小物体。
- 通过跨窗口注意力聚合不同窗口的特征,以建模长距离空间依赖关系,并解决模糊的局部预测问题。
- 在最后一层引入物体感知标记,以动态确定预测标签的数量,提升对可变标签数量的适应能力。
- 采用弧 Sigmoid 损失函数,通过缩放特征嵌入之间的余弦相似度来稳定训练,最优缩放因子 s=8 时性能最佳。
- 采用端到端训练方式,结合二元交叉熵损失与弧 Sigmoid 损失,以优化特征分布并提升泛化性能。
实验结果
研究问题
- RQ1Transformer 架构如何更好地处理在 CNN 特征提取过程中常因下采样而丢失的小物体?
- RQ2跨窗口注意力在多大程度上能提升模型区分高度相似物体(如背包与手提包)的能力?
- RQ3能否通过捕捉全局空间关系的自注意力机制,减少因特定物体类别频繁共现而导致的误分类?
- RQ4物体感知标记的集成如何影响模型在多标签场景下预测可变数量标签的能力?
- RQ5弧 Sigmoid 损失函数在多标签分类任务中提升 mAP 的最优配置是什么?
主要发现
- MlTr 在 MS-COCO 数据集上实现 88.5% 的 mAP,达到最先进性能,显著优于此前最先进方法。
- 在 Pascal-VOC 上,MlTr 实现 95.8% 的 mAP,表明其在多样化物体类别和复杂场景中具备强大泛化能力。
- 在 NUS-WIDE 上,MlTr 实现 66.3% 的 mAP,CF1 提升至 65.0,OF1 达 75.8,表明标签一致性与精确度均得到改善。
- 消融实验表明,跨窗口注意力带来 +1.0 mAP 的提升,凸显其在建模长距离空间依赖中的关键作用。
- 对于小物体,MlTr 将 mAP 从 ResNet101 的 68.8 提升至 77.6,提升近 10 个百分点,证实其在检测细微细节方面的有效性。
- 通过 t-SNE 可视化结果表明,MlTr 更好地区分相似物体类别(如滑雪板与单板滑雪,遥控器与手机),并避免虚假共现偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。