[论文解读] Cross-Modality Attention with Semantic Graph Embedding for Multi-Label Classification
本文提出了一种基于语义图嵌入的跨模态注意力机制,用于多标签图像与视频分类。通过基于邻接关系的相似性图嵌入学习标签关系,并利用这些嵌入指导注意力图,该方法提升了特征定位能力,并捕获了空间与时间依赖性,在 MS-COCO、NUS-WIDE 和 YouTube-8M Segments 数据集上实现了最先进性能。
Multi-label image and video classification are fundamental yet challenging tasks in computer vision. The main challenges lie in capturing spatial or temporal dependencies between labels and discovering the locations of discriminative features for each class. In order to overcome these challenges, we propose to use cross-modality attention with semantic graph embedding for multi label classification. Based on the constructed label graph, we propose an adjacency-based similarity graph embedding method to learn semantic label embeddings, which explicitly exploit label relationships. Then our novel cross-modality attention maps are generated with the guidance of learned label embeddings. Experiments on two multi-label image classification datasets (MS-COCO and NUS-WIDE) show our method outperforms other existing state-of-the-arts. In addition, we validate our method on a large multi-label video classification dataset (YouTube-8M Segments) and the evaluation results demonstrate the generalization capability of our method.
研究动机与目标
- 为解决多标签图像与视频分类中捕捉标签间语义依赖关系的挑战。
- 通过将语义引导融入注意力机制,提升判别性图像或视频区域的定位能力。
- 通过学习的语义图嵌入显式建模标签关系,以增强分类性能。
- 开发一种在图像与视频多标签分类任务中均具泛化能力的框架。
提出的方法
- 提出一种基于邻接关系的相似性图嵌入(ASGE)方法,通过图结构中的标签共现与相似性关系学习语义标签嵌入。
- 引入跨模态注意力(CMA),其中注意力图使用学习到的标签嵌入作为先验引导,提升可解释性与相关性。
- 将视觉特征投影到共享语义空间,以实现视觉与标签嵌入之间的跨模态对齐。
- 使用类别特定的注意力图聚合视觉特征,随后通过最终分类头进行分类。
- 采用端到端联合优化框架,联合优化 ASGE 与 CMA 模块,实现特征与标签表示的联合学习。
- 对 ASGE 训练应用松弛技术,并在图像与视频基准上使用带动量的 SGD 进行优化。
实验结果
研究问题
- RQ1显式建模标签关系是否能提升多标签图像分类性能?
- RQ2由学习到的语义标签嵌入引导的注意力机制,是否能比标准自注意力更准确地定位判别性图像区域?
- RQ3所提出的 CMA 机制在具有时间依赖性的视频分类任务中是否具备良好的泛化能力?
- RQ4语义图嵌入的整合如何增强多标签分类中的空间或时间上下文建模?
主要发现
- 在 MS-COCO 数据集上,所提方法实现了 83.8% 的 mAP,较先前最先进方法(MS-CMA)高出 0.4 个百分点。
- 在 NUS-WIDE 数据集上,该方法实现了最先进性能,展现出在多样化多标签基准上的强大泛化能力。
- 在 YouTube-8M Segments 数据集上,CMA 模型在 SNet 架构下实现了 55.8% 的 mAP,较自注意力基线高出 2.6 个百分点。
- 可视化结果表明,CMA 注意力图能更准确地聚焦于语义相关区域,例如因语义相似性而同时关注网球拍与网球。
- 通过利用相关标签的上下文线索,模型在检测小尺寸或难以辨识物体时表现出鲁棒性。
- 消融实验确认,即使仅使用帧级特征(无音频或模型集成),CMA 机制相比标准自注意力仍显著提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。