[论文解读] Attention-Driven Dynamic Graph Convolutional Network for Multi-Label Image Recognition
该论文提出了一种注意力驱动的动态图卷积网络(ADD-GCN),用于多标签图像识别,通过内容感知的类别表征动态构建图像特定的图结构,以克服静态标签依赖图中的频率偏差问题。通过将语义注意力模块(SAM)与联合使用静态图和动态图的动态图卷积网络(D-GCN)相结合,ADD-GCN在MS-COCO上实现了85.2%的mAP,VOC2007上达到96.0%,VOC2012上达到95.5%,性能达到当前最优水平。
Recent studies often exploit Graph Convolutional Network (GCN) to model label dependencies to improve recognition accuracy for multi-label image recognition. However, constructing a graph by counting the label co-occurrence possibilities of the training data may degrade model generalizability, especially when there exist occasional co-occurrence objects in test images. Our goal is to eliminate such bias and enhance the robustness of the learnt features. To this end, we propose an Attention-Driven Dynamic Graph Convolutional Network (ADD-GCN) to dynamically generate a specific graph for each image. ADD-GCN adopts a Dynamic Graph Convolutional Network (D-GCN) to model the relation of content-aware category representations that are generated by a Semantic Attention Module (SAM). Extensive experiments on public multi-label benchmarks demonstrate the effectiveness of our method, which achieves mAPs of 85.2%, 96.0%, and 95.5% on MS-COCO, VOC2007, and VOC2012, respectively, and outperforms current state-of-the-art methods with a clear margin. All codes can be found at https://github.com/Yejin0111/ADD-GCN.
研究动机与目标
- 解决静态标签依赖图中的频率偏差问题,即训练数据中共现频率过度影响模型预测结果。
- 通过学习图像特定的标签关系而非依赖全局固定图结构,提升多标签识别的鲁棒性。
- 通过建模每张输入图像中标签之间的细粒度、内容感知语义关系,增强特征判别能力。
- 构建一个端到端框架,整合语义注意力与动态图学习,以提升多标签分类性能。
提出的方法
- 使用语义注意力模块(SAM)将卷积特征图分解为内容感知的、类别特定的表征,通过聚焦于语义区域实现。
- 通过轻量级网络应用于类别特定表征,构建动态相关性矩阵,实现图像特定的标签关系建模。
- 在动态图卷积网络(D-GCN)中联合集成静态图(基于全局共现频率学习)与动态图(每张图像独立学习),实现联合特征传播。
- 在两个图上分别执行图卷积操作,以优化类别表征,随后进行全局平均池化并为每个标签执行分类。
- 在分类器后应用GMP(全局最大池化),采用改进的CAM风格机制,以更好地保留判别性局部区域并提升特征表征。
- 通过求和、平均和最大池化融合类别特定特征,消融实验表明求和池化性能更优。
实验结果
研究问题
- RQ1与基于频率的静态图相比,动态、图像特定的标签依赖图是否能提升多标签识别性能?
- RQ2通过注意力机制实现的内容感知类别表征,是否能增强模型定位和区分相关语义区域的能力?
- RQ3静态与动态图的联合学习框架是否能更好地捕捉粗粒度与细粒度的标签依赖关系?
- RQ4与现有最先进方法相比,该方法在标准基准上的表现如何?
- RQ5改进的CAM机制(cls → GMP)在提升特征表征与分类准确率方面有何贡献?
主要发现
- ADD-GCN在MS-COCO基准上实现了85.2%的新SOTA mAP,显著优于先前方法。
- 在VOC2007数据集上,ADD-GCN实现了96.0%的mAP,创下多标签识别新纪录。
- 在VOC2012基准上,该模型达到95.5%的mAP,展现出强大的泛化能力与鲁棒性。
- 消融实验表明,通过求和池化实现的类别特定特征表征优于平均池化或最大池化等聚合表征。
- 可视化结果表明,SAM能准确定位相关类别的语义区域,且动态图能学习到有意义的、图像特定的标签相关性。
- 改进的CAM机制(cls → GMP)优于标准GAP与GMP基线,表明其在特征判别力与鲁棒性方面均有提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。