Skip to main content
QUICK REVIEW

[论文解读] Learning Category Correlations for Multi-label Image Recognition with Graph Networks

Qing Li, Xiaojiang Peng|arXiv (Cornell University)|Sep 28, 2019
Text and Document Classification Technologies参考文献 40被引用 18
一句话总结

本文提出A-GCN,一种新颖的图神经网络框架,通过词嵌入和1×1卷积,学习用于多标签图像识别的自适应标签相关图。通过引入稀疏相关性约束和即插即用的标签图模块,A-GCN在MS-COCO和Fashion550K数据集上超越基线方法,实现SOTA性能,在MS-COCO上相比ResNet101将mAP提升2.8%。

ABSTRACT

Multi-label image recognition is a task that predicts a set of object labels in an image. As the objects co-occur in the physical world, it is desirable to model label dependencies. Previous existing methods resort to either recurrent networks or pre-defined label correlation graphs for this purpose. In this paper, instead of using a pre-defined graph which is inflexible and may be sub-optimal for multi-label classification, we propose the A-GCN, which leverages the popular Graph Convolutional Networks with an Adaptive label correlation graph to model label dependencies. Specifically, we introduce a plug-and-play Label Graph (LG) module to learn label correlations with word embeddings, and then utilize traditional GCN to map this graph into label-dependent object classifiers which are further applied to image features. The basic LG module incorporates two 1x1 convolutional layers and uses the dot product to generate label graphs. In addition, we propose a sparse correlation constraint to enhance the LG module and also explore different LG architectures. We validate our method on two diverse multi-label datasets: MS-COCO and Fashion550K. Experimental results show that our A-GCN significantly improves baseline methods and achieves performance superior or comparable to the state of the art.

研究动机与目标

  • 解决多标签图像识别中预定义、僵化标签相关图的局限性。
  • 以数据驱动、端到端可训练的方式建模语义标签依赖关系。
  • 通过从词嵌入中学习动态、自适应的标签相关性,提升多标签分类性能。
  • 利用稀疏相关性约束提升泛化能力和鲁棒性,防止过平滑。
  • 评估不同标签图架构在捕捉标签共现模式方面的有效性。

提出的方法

  • 提出一种即插即用的标签图(LG)模块,利用两层1×1卷积和点积操作,从词嵌入生成自适应标签相关图。
  • 采用图卷积网络(GCN)将学习到的标签图映射为依赖标签的分类器,应用于图像特征。
  • 通过L1-范数损失在学习到的相关性矩阵与单位矩阵之间施加稀疏相关性约束,以鼓励稀疏性并减少过平滑。
  • 探索多种替代的LG架构,包括全连接和基于注意力的变体,以评估其鲁棒性和性能。
  • 使用组合损失函数端到端训练整个模型,损失函数包含分类损失和稀疏相关性正则化项。
  • 将词嵌入作为LG模块的输入,以编码标签之间的语义关系,而无需依赖手工构建的图结构。

实验结果

研究问题

  • RQ1端到端可训练的自适应标签相关图是否能在多标签图像识别中超越固定或预定义图?
  • RQ2稀疏相关性约束在防止标签图学习中的过平滑并提升泛化能力方面有多有效?
  • RQ3不同标签图架构(如全连接、基于注意力的)在多标签识别中是否带来显著性能差异?
  • RQ4所提出的A-GCN框架能否在具有不同标签共现模式的多样化数据集上实现良好泛化?
  • RQ5与标准GCN或基线CNN相比,自适应图能带来多大性能提升?

主要发现

  • 在MS-COCO上,A-GCN将mAP从基线ResNet101的80.3%提升至83.1%,优于SOTA方法ML-GCN。
  • 稀疏相关性约束(L_A)通过减少过平滑提升性能,最优α=1.0;更高值会降低性能。
  • LG模块的FC-A架构在各类替代方案中表现最佳,优于默认的1×1卷积设计。
  • 在Fashion550K上,A-GCN在干净数据上微调后达到66.32%的mAP,较基线提升3.4%,优于重新实现的ML-GCN。
  • 可视化结果表明,在共现物体类别(如勺子、背包、牙刷)上性能显著提升,证实了标签依赖关系的有效学习。
  • 该方法在不同数据集上泛化良好,在MS-COCO和Fashion550K上均在多种训练设置下表现出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。