[论文解读] Contrastive Object Detection Using Knowledge Graph Embeddings
本文提出将知识图谱嵌入(如 ConceptNet、GloVe)作为目标检测模型中的类别原型,以替代标准的 one-hot 类别表示。通过使用对比损失将视觉特征与语义嵌入对齐,该方法在 COCO 和 Cityscapes 上实现了与基线模型相当的准确率,同时生成了更具语义一致性的误分类结果,尤其在使用 ConceptNet 嵌入和余弦距离时表现更优。
Object recognition for the most part has been approached as a one-hot problem that treats classes to be discrete and unrelated. Each image region has to be assigned to one member of a set of objects, including a background class, disregarding any similarities in the object types. In this work, we compare the error statistics of the class embeddings learned from a one-hot approach with semantically structured embeddings from natural language processing or knowledge graphs that are widely applied in open world object detection. Extensive experimental results on multiple knowledge-embeddings as well as distance metrics indicate that knowledge-based class representations result in more semantically grounded misclassifications while performing on par compared to one-hot methods on the challenging COCO and Cityscapes object detection benchmarks. We generalize our findings to multiple object detection architectures by proposing a knowledge-embedded design for keypoint-based and transformer-based object detection architectures.
研究动机与目标
- 为解决目标检测中 one-hot 类别表示的局限性,即类别被视为离散且无关,导致语义不一致的误分类。
- 探究基于 NLP 或知识图谱的知识型类别原型是否能提升目标检测预测的语义一致性。
- 评估不同知识嵌入和距离度量对检测性能及错误分布的影响。
- 将知识嵌入方法扩展至多种架构,包括两阶段、关键点检测和 Transformer 基础检测器。
- 分析知识嵌入模型是否能减少类别间混淆并提升零样本泛化能力。
提出的方法
- 在检测头中,用预训练的知识图谱嵌入(如 ConceptNet、GloVe)替代可学习的 one-hot 类别原型作为类别原型。
- 使用对比损失将视觉特征嵌入与对应的知识图谱嵌入对齐,以鼓励语义相似性。
- 将知识嵌入分类头集成到 Faster R-CNN、CenterNet 和 DETR 架构中,保持端到端训练。
- 主要采用余弦距离计算视觉特征与类别原型之间的相似度,以支持语义推理。
- 在 COCO 2017 和 Cityscapes 上使用标准训练协议进行训练,并对嵌入类型和距离度量进行消融研究。
- 通过比较 one-hot 模型与知识嵌入模型的混淆矩阵及错误分布之间的 Jensen-Shannon 散度,进行错误分析。
实验结果
研究问题
- RQ1用知识图谱嵌入替代 one-hot 类别原型是否能带来更语义一致的误分类?
- RQ2不同知识嵌入(如 ConceptNet、GloVe)和距离度量(如余弦、L2)如何影响检测性能和错误模式?
- RQ3知识嵌入分类头是否能更好地泛化到未见或罕见物体类别?
- RQ4与标准 one-hot 基线相比,知识嵌入模型在多大程度上减少了类别间混淆?
- RQ5知识嵌入的集成是否能提升零样本或少样本场景下的检测鲁棒性?
主要发现
- 知识嵌入模型在 COCO 2017 和 Cityscapes 基准上的平均精度与标准 one-hot 基线相当。
- 使用 ConceptNet 嵌入与余弦距离时,类别间混淆最低,表明误分类的语义一致性得到提升。
- 知识嵌入模型的错误分布与真实类别结构之间的 Jensen-Shannon 散度显著降低,表明错误更具语义基础。
- KGE 基模型在未见物体上的误报更少(例如,将雪地车误判为汽车而非飞机),表现出更好的泛化能力。
- CenterNet 架构在错误特征上表现出最大的性能差距,表明在知识嵌入下,定位与分类头之间存在更强的交互作用。
- 该方法在多种架构上均表现良好,包括两阶段、关键点检测和 Transformer 基础检测器,证实了其广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。