Skip to main content
QUICK REVIEW

[论文解读] Scene Graph based Image Retrieval -- A case study on the CLEVR Dataset

Sahana Ramnath, Amrita Saha|arXiv (Cornell University)|Nov 3, 2019
Multimodal Machine Learning Applications参考文献 7被引用 9
一句话总结

本文提出了一种基于神经符号场景图的图像检索框架,将一次检索和迭代检索建模为查询图与目录场景图之间的可学习图匹配问题。通过REINFORCE算法端到端训练,该方法在20%属性缺失时达到89%的准确率,在30%缺失时达到75%,展现出对描述不充分查询的鲁棒性,同时通过问答循环实现交互式精炼。

ABSTRACT

With the prolification of multimodal interaction in various domains, recently there has been much interest in text based image retrieval in the computer vision community. However most of the state of the art techniques model this problem in a purely neural way, which makes it difficult to incorporate pragmatic strategies in searching a large scale catalog especially when the search requirements are insufficient and the model needs to resort to an interactive retrieval process through multiple iterations of question-answering. Motivated by this, we propose a neural-symbolic approach for a one-shot retrieval of images from a large scale catalog, given the caption description. To facilitate this, we represent the catalog and caption as scene-graphs and model the retrieval task as a learnable graph matching problem, trained end-to-end with a REINFORCE algorithm. Further, we briefly describe an extension of this pipeline to an iterative retrieval framework, based on interactive questioning and answering.

研究动机与目标

  • 解决在大规模目录中因描述不完整或模糊而导致的基于文本的图像检索挑战。
  • 将符号结构化推理(通过场景图)与神经学习相结合,以提升可解释性和鲁棒性。
  • 通过问答循环实现交互式、迭代式检索,利用反馈对查询图进行精炼。
  • 将检索建模为基于图子sumerption和注意力匹配的战略性搜索问题。
  • 在CLEVR基准上展示神经符号方法在一次性检索和交互式检索中的可行性。

提出的方法

  • 使用对象属性(颜色、形状)和空间关系,将目录图像和查询描述表示为场景图。
  • 通过合并所有图像的场景图构建统一的“目录图”,并为节点和边建立倒排索引以支持高效查找。
  • 使用SPICE框架将输入描述解析为“查询图”,对未知属性使用零嵌入。
  • 基于是否在查询中出现属性,使用加权Frobenius距离定义节点和三元组的子sumerption得分,权重由此决定。
  • 通过在目录图上计算注意力图,基于最佳匹配的节点和三元组计算每个图像的动作概率。
  • 使用REINFORCE算法训练检索策略,奖励函数基于黄金图像表示与检索图像表示之间的归一化L2距离。

实验结果

研究问题

  • RQ1基于场景图的神经符号方法是否能提升在描述不完整或不充分情况下的单次图像检索性能?
  • RQ2结合注意力匹配的图子sumerption在从大规模目录中检索正确图像方面有多高效?
  • RQ3所提出的框架能否扩展以支持通过问答循环实现的交互式、迭代式检索?
  • RQ4当查询中缺少关键属性或关系时,模型表现如何?
  • RQ5通过引入可学习的提问者与回答者,是否能通过战略性探测提升检索效率?

主要发现

  • 当完整场景图作为输入时,模型的检索准确率达到99.9%。
  • 当查询中20%的节点被移除时,准确率下降至89%,表明对部分或不完整描述具有鲁棒性。
  • 当30%的节点缺失时,准确率降至75%,证明模型具备处理显著信息丢失的能力。
  • 通过集成问答循环,该框架可自然扩展至迭代检索,实现多轮对查询图的精炼。
  • 使用可学习策略选择问题,能够通过战略性探测有效缩小搜索空间。
  • 基于REINFORCE的训练方案在稀疏奖励下有效优化了检索策略,如信息缺失时性能下降所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。