Skip to main content
QUICK REVIEW

[论文解读] Referring Expression Grounding by Marginalizing Scene Graph Likelihood

Daqing Liu, Hanwang Zhang|arXiv (Cornell University)|Jun 9, 2019
Multimodal Machine Learning Applications被引用 7
一句话总结

本文提出了一种名为边际化场景图似然(MSGL)的新方法,用于指代表达定位任务。该方法通过场景图建模对象、属性和关系,并利用条件随机场(CRF)与求和-乘积信念传播来推理未标注的上下文。MSGL在三个基准测试中均达到最先进性能,同时实现了对句子中提及的所有对象的可解释、完整定位。

ABSTRACT

We focus on task of grounding referring expressions images, e.g., localizing the white truck front of a one. To resolve this task fundamentally, one should first find out contextual objects (e.g., yellow truck) and then exploit them to disambiguate referent from other similar objects, by using attributes and relationships (e.g., white, yellow, in front of). However, it is extremely challenging to train such a model as ground-truth of contextual objects and their relationships are usually missing due to prohibitive annotation cost. Therefore, nearly all existing methods attempt to evade above joint grounding and reasoning process, but resort to a holistic association between sentence and region feature. As a result, they suffer from heavy parameters of fully-connected layers, poor interpretability, and limited generalization to unseen expressions. In this paper, we tackle this challenge by training and inference with proposed Marginalized Scene Graph Likelihood (MSGL). Specifically, we use scene graph: a graphical representation parsed from referring expression, where nodes are objects with attributes and edges are relationships. Thanks to conditional random field (CRF) built on scene graph, we can ground every object to its corresponding region, and perform reasoning with unlabeled contexts by marginalizing out them using sum-product belief propagation. Overall, our proposed MSGL is effective and interpretable, e.g., on three benchmarks, MSGL consistently outperforms state-of-the-arts while offers a complete grounding of all objects a sentence.

研究动机与目标

  • 解决在图像中进行指代表达定位时,由于标注成本高昂,真实上下文对象和关系往往不可用的问题。
  • 克服现有方法依赖整体句子-区域关联所带来的局限性,这些方法导致参数量高、可解释性差且泛化能力有限。
  • 通过结构化场景图表示,实现对指代表达中对象、属性和关系的联合推理。
  • 开发一种训练与推理框架,通过在条件随机场上使用求和-乘积信念传播,对未标注的上下文对象进行边际化处理。
  • 通过将句子中的每个对象定位到其对应的图像区域,实现高性能与可解释性的统一。

提出的方法

  • 从指代表达构建场景图,其中节点表示带有属性的对象,边表示对象之间的关系。
  • 在场景图上构建条件随机场(CRF),以建模对象预测及其空间或语义关系之间的依赖性。
  • 在推理过程中使用求和-乘积信念传播对未标注的上下文对象进行边际化,从而在无需所有对象完全监督的情况下实现鲁棒推理。
  • 使用可微分目标函数进行模型训练,以最大化场景图的边际似然,支持端到端学习。
  • 通过预测场景图中每个对象最可能的区域,实现定位,同时利用局部特征与关系上下文。
  • 将场景图解析与定位整合到统一框架中,支持联合推理与可解释性。

实验结果

研究问题

  • RQ1基于场景图的表示是否能够提升指代表达定位模型的可解释性与性能?
  • RQ2通过信念传播对未标注的上下文对象进行边际化,在减少对完全标注关系依赖方面的有效性如何?
  • RQ3与整体句子-区域匹配方法相比,显式建模属性与关系是否能带来在未见指代表达上的更好泛化能力?
  • RQ4基于CRF的结构化预测框架是否能在保持对句子中所有对象完整定位的同时,实现最先进性能?
  • RQ5所提出的MSGL方法在多种基准测试中,其准确率与鲁棒性相较于现有方法提升程度如何?

主要发现

  • MSGL在三个标准指代表达定位基准测试中均达到最先进性能,持续优于先前方法。
  • 该模型实现了对指代表达中提及的所有对象的完整定位,包括指代对象与上下文对象。
  • 通过未标注上下文的边际化处理,MSGL降低了对完全标注关系的依赖,提升了模型的鲁棒性与泛化能力。
  • 使用场景图与基于CRF的推理机制显著增强了模型可解释性,使用户能够追踪关系与属性如何影响定位决策。
  • 由于对关系结构进行了有组织的建模,该方法在参数量少于全连接层方法的情况下仍实现了高准确率。
  • 求和-乘积信念传播在无需所有对象具备真实标注关系的情况下,有效支持了复杂关系结构的推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。