Skip to main content
QUICK REVIEW

[论文解读] Describing Natural Images Containing Novel Objects with Knowledge Guided Assitance

Aditya Mogadala, Umanga Bista|arXiv (Cornell University)|Oct 17, 2017
Image Retrieval and Classification Techniques参考文献 1被引用 9
一句话总结

本文提出知识引导辅助(KGA),一种两阶段方法,通过利用知识库(KB)引导语义注意力和约束推理,提升对新对象的图像字幕生成性能。首先,训练一个多实体标签图像分类器,将视觉对象与KB实体关联;随后,利用这些标签作为字幕生成过程中的外部注意力和动态约束,显著提升了在MSCOCO等开放域图像字幕基准上的表现。

ABSTRACT

Images in the wild encapsulate rich knowledge about varied abstract concepts and cannot be sufficiently described with models built only using image-caption pairs containing selected objects. We propose to handle such a task with the guidance of a knowledge base that incorporate many abstract concepts. Our method is a two-step process where we first build a multi-entity-label image recognition model to predict abstract concepts as image labels and then leverage them in the second step as an external semantic attention and constrained inference in the caption generation model for describing images that depict unseen/novel objects. Evaluations show that our models outperform most of the prior work for out-of-domain captioning on MSCOCO and are useful for integration of knowledge and vision in general.

研究动机与目标

  • 解决图像字幕模型在描述训练数据中未出现的未见或新对象时的局限性。
  • 通过整合来自知识库(KB)的结构化知识,提升对开放域视觉概念的字幕生成性能。
  • 开发一种在字幕生成过程中利用KB实体作为外部语义注意力和动态约束的方法。
  • 克服仅基于图像-字幕平行语料训练的模型在词汇和语义上的局限性。

提出的方法

  • 训练一个多标签图像分类器,将知识库实体作为图像标签,将视觉对象与KB中的抽象概念对齐。
  • 知识引导辅助(KGA)在字幕生成过程中使用预测的KB实体标签作为外部语义注意力。
  • 通过将实体相关性分数融入注意力机制,对解码器施加动态约束。
  • 模型采用两阶段训练流程:首先在图像-KB实体对上训练图像分类器;其次,使用KGA引导对字幕生成器进行微调。
  • 字幕生成模型采用基于LSTM的解码器与软注意力机制,其中注意力权重由KB中的实体相关性分数调制。
  • 通过引入KGA约束的束搜索推理方法进行评估,提升了对未见对象的泛化能力。

实验结果

研究问题

  • RQ1知识库能否提升对训练字幕数据中未出现的未见或新对象图像的字幕生成性能?
  • RQ2如何有效将KB中的结构化知识整合到字幕生成模型的注意力机制中?
  • RQ3在推理过程中使用KB实体作为动态约束,是否能提升对开放域对象的字幕质量?
  • RQ4在未见对象字幕生成任务上,KGA与DCC、NOC和LSTM-C等现有方法相比性能如何?
  • RQ5语言模型隐藏层维度和束搜索策略的变化对KGA性能有何影响?

主要发现

  • KGA-CGM在MSCOCO的'未见'数据集上取得了22.2的最高METEOR分数,优于包括NOC和LSTM-C在内的先前方法。
  • 在'新对象'数据集上,KGA-CGM的SPICE得分为14.6,显著高于NOC(13.3)和LSTM-C(13.9)。
  • 隐藏层维度为512的模型在'未见'数据集上取得了54.5的最高F1分数,表明更大的隐藏状态提升了模型鲁棒性。
  • 定性分析表明,预测的实体标签(如'Wine_bottle'、'Bus'、'Zebra')提升了字幕的相关性和语义准确性。
  • 注意力可视化结果证实,KGA在字幕生成过程中能有效聚焦于相关KB实体,尤其在新对象上表现显著。
  • 消融实验表明,将LSTM隐藏层维度从256提升至512,使'未见'数据集上的F1分数提升了6.3个百分点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。