Skip to main content
QUICK REVIEW

[论文解读] Sketching Image Gist: Human-Mimetic Hierarchical Scene Graph Generation

Wenbin Wang, Ruiping Wang|arXiv (Cornell University)|Jul 17, 2020
Multimodal Machine Learning Applications参考文献 56被引用 10
一句话总结

本文提出了一种模仿人类的层次化场景图生成框架,通过层次化实体树(HET)和混合LSTM建模人类感知,编码层次化与兄弟上下文关系。关系排序模块(RRM)利用对象显著性与尺寸优先排序关键关系,在场景图生成任务中达到最先进性能,并更优地挖掘图像特有的、揭示整体语义的关系。

ABSTRACT

Scene graph aims to faithfully reveal humans' perception of image content. When humans analyze a scene, they usually prefer to describe image gist first, namely major objects and key relations in a scene graph. This humans' inherent perceptive habit implies that there exists a hierarchical structure about humans' preference during the scene parsing procedure. Therefore, we argue that a desirable scene graph should be also hierarchically constructed, and introduce a new scheme for modeling scene graph. Concretely, a scene is represented by a human-mimetic Hierarchical Entity Tree (HET) consisting of a series of image regions. To generate a scene graph based on HET, we parse HET with a Hybrid Long Short-Term Memory (Hybrid-LSTM) which specifically encodes hierarchy and siblings context to capture the structured information embedded in HET. To further prioritize key relations in the scene graph, we devise a Relation Ranking Module (RRM) to dynamically adjust their rankings by learning to capture humans' subjective perceptive habits from objective entity saliency and size. Experiments indicate that our method not only achieves state-of-the-art performances for scene graph generation, but also is expert in mining image-specific relations which play a great role in serving downstream tasks.

研究动机与目标

  • 为解决现有场景图生成方法缺乏层次结构的问题,该问题无法反映人类感知习惯。
  • 通过层次化实体表示,建模人类对图像整体语义(主要对象与关键关系)的描述偏好。
  • 开发一种关系排序模块(RRM),优先排序图像特有的、感知上重要的关系,而非琐碎或常识性关系。
  • 构建一个新的基准数据集VG-KR,基于MSCOCO字幕中的关键关系标注,用于评估关系重要性。
  • 通过生成更准确反映图像核心视觉内容的场景图,提升下游任务(如图像字幕生成)的性能。

提出的方法

  • 将图像表示为层次化实体树(HET),其中每个节点为一个对象,可进一步分解为更细粒度的子对象,以模仿人类感知的层次结构。
  • 使用混合LSTM编码HET中的层次结构与兄弟上下文,捕捉跨感知层级的结构化关系。
  • 设计一种关系排序模块(RRM),基于对象视觉显著性与归一化尺寸学习关系的排序,以反映人类主观重要性。
  • 引入新的关系重要性指标:Φ′ = S^sub + S^obj + A(o^sub)/A(o_I) + A(o^obj)/A(o_I),结合显著性与相对尺寸,以平衡对小型组件的高估问题。
  • 扩展Visual Genome数据集,构建VG-KR,一个基于MSCOCO字幕中提取的关键关系标注数据集,用于训练与评估RRM。
  • 通过RRM对关系进行排序生成场景图,将排名靠前的关系作为图像整体语义的核心,并用于字幕生成与下游任务。

实验结果

研究问题

  • RQ1如何使场景图生成更符合人类感知层次,特别是在优先关注主要事件与关键关系方面?
  • RQ2对象显著性与尺寸在多大程度上可预测人类在图像描述中对关系的偏好?
  • RQ3与平坦的非层次化方法相比,层次化场景图表示能否提升生成场景图的质量与相关性?
  • RQ4所提出的RRM在识别图像特有的、非平凡关系(而非常识或背景关系)方面效果如何?
  • RQ5引入模仿人类的层次化结构是否能提升下游任务(如图像字幕生成)的性能?

主要发现

  • 所提出的HetH-RRM模型在标准场景图生成基准上达到最先进性能,在检测与排序指标上均优于先前方法。
  • 关系排序模块(RRM)显著提升了对图像特异性关系的挖掘能力,HetH-RRM中排名靠前的关系更贴近图像整体语义,优于基线模型。
  • 消融实验证明,RRM指标(Φ′)中结合对象显著性与归一化尺寸,能与IDC与CS呈现强相关性,验证了设计选择的合理性。
  • 定性结果表明,基于HetH-RRM中高阶关系生成的字幕更完整地覆盖了图像核心内容,如“一位女性撑着雨伞”,而无RRM的模型则表现较差。
  • VG-KR数据集分析显示,现有方法常将琐碎或常识性关系(如“女人有头”)列为最优先关系,即使图像实际核心语义不同。
  • 对低IDC/高CS与高IDC/低CS关系三元组的分析表明,小型显著组件常产生误导性高的显著性得分但感知重要性低,从而证明了引入尺寸感知排序的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。