Skip to main content
QUICK REVIEW

[论文解读] Scene Graph Parsing as Dependency Parsing

Yu-Siang Wang, Chenxi Liu|arXiv (Cornell University)|Mar 25, 2018
Multimodal Machine Learning Applications参考文献 43被引用 7
一句话总结

本文提出了一种新颖的端到端神经依赖解析器,用于场景图解析,通过将场景图重新解释为以边为中心的依赖结构。通过重新设计标签空间和动作空间,聚焦于对象、属性和关系,该模型优于先前的两阶段方法,在场景图解析任务上达到49.67%的F值——比之前的最先进方法高出5个百分点,同时在图像检索任务中也表现出更优的性能。

ABSTRACT

In this paper, we study the problem of parsing structured knowledge graphs from textual descriptions. In particular, we consider the scene graph representation that considers objects together with their attributes and relations: this representation has been proved useful across a variety of vision and language applications. We begin by introducing an alternative but equivalent edge-centric view of scene graphs that connect to dependency parses. Together with a careful redesign of label and action space, we combine the two-stage pipeline used in prior work (generic dependency parsing followed by simple post-processing) into one, enabling end-to-end training. The scene graphs generated by our learned neural dependency parser achieve an F-score similarity of 49.67% to ground truth graphs on our evaluation set, surpassing best previous approaches by 5%. We further demonstrate the effectiveness of our learned parser on image retrieval applications.

研究动机与目标

  • 解决两阶段场景图解析流水线的局限性,这些流水线依赖通用依赖解析,随后进行启发式或简单分类器的后处理。
  • 通过将场景图重新定义为以边为中心的视角,实现更自然地与依赖解析结构对齐,从而提升可解释性和性能。
  • 消除对预训练语言依赖解析器的依赖,转而直接在视觉-语言场景图数据上训练定制化的神经依赖解析器。
  • 不仅在F值上,还在下游视觉任务(如图像检索)中评估解析器的有效性。
  • 探索将图像锚定的场景图作为比密集向量嵌入更鲁棒、更具语义意义的表示形式的潜力。

提出的方法

  • 将场景图重新表述为以边为中心的依赖结构,其中边表示关系(对象、属性、关系),而非节点。
  • 重新设计标签空间,仅包含三种类型:对象、属性和关系,消除标准依赖解析中的冗余语言标签。
  • 修改动作空间,允许非主干节点的出现,使解析器能够省略功能词,专注于语义内容。
  • 使用BIST框架(Kiperwasser和Goldberg,2016)训练单一端到端神经依赖解析器,并在Visual Genome数据集上进行微调,结合单词到节点的对齐映射。
  • 采用监督学习设置,使用标准场景图标注进行训练,直接在场景图结构上进行端到端学习,跳过中间依赖树的构建。
  • 通过将解析后的场景图作为查询表示,利用召回率@5、召回率@10和中位数排名来衡量图像检索性能,将解析器应用于图像检索任务。

实验结果

研究问题

  • RQ1通过将场景图以边为中心的方式重新解释,能否将场景图解析与依赖解析统一?
  • RQ2具有简化标签空间和动作空间的定制化依赖解析器是否优于结合通用依赖解析与后处理的两阶段流水线?
  • RQ3在视觉-语言数据上进行端到端训练,是否能相比从语言树库迁移知识,显著提升场景图解析的准确性?
  • RQ4所学解析器在多大程度上能泛化到下游视觉任务(如图像检索)?
  • RQ5句子到图的对齐质量在多大程度上影响最终的解析性能和泛化能力?

主要发现

  • 所提出的端到端神经依赖解析器在场景图解析任务上达到49.67%的F值,比最佳先前方法高出5个百分点。
  • 在图像检索任务中,该解析器优于Stanford场景图解析器,实现了更高的召回率@5、召回率@10和中位数排名,表明其在视觉应用中具有更好的泛化能力。
  • 在对齐的训练图上,其最优F值达到69.85%,表明通过改进对齐或模型架构,仍有进一步提升空间。
  • 消融实验表明,该解析器对CONT弧方向等设计选择具有鲁棒性,验证了架构的稳定性。
  • 性能提升主要归因于解析与场景图结构的联合优化,而非依赖独立的后处理步骤。
  • 结果表明,如Johnson等人(2015)所做,将场景图锚定到视觉区域但忽略属性和关系,是次优的,且解析质量显著影响检索性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。