Skip to main content
QUICK REVIEW

[论文解读] An Interpretable Model for Scene Graph Generation

Ji Zhang, Kevin J. Shih|arXiv (Cornell University)|Nov 21, 2018
Multimodal Machine Learning Applications参考文献 23被引用 8
一句话总结

该论文提出了一种新颖的、可解释的场景图生成模型,通过三个独立分支显式建模视觉、空间和语义特征,随后进行晚期融合,从而能够清晰分析每种特征的贡献。该模型取得了最先进性能,在 OpenImages 视觉关系检测挑战赛中获得第一名,相较于第二名有 20% 的相对提升。

ABSTRACT

We propose an efficient and interpretable scene graph generator. We consider three types of features: visual, spatial and semantic, and we use a late fusion strategy such that each feature's contribution can be explicitly investigated. We study the key factors about these features that have the most impact on the performance, and also visualize the learned visual features for relationships and investigate the efficacy of our model. We won the champion of the OpenImages Visual Relationship Detection Challenge on Kaggle, where we outperform the 2nd place by 5\% (20\% relatively). We believe an accurate scene graph generator is a fundamental stepping stone for higher-level vision-language tasks such as image captioning and visual QA, since it provides a semantic, structured comprehension of an image that is beyond pixels and objects.

研究动机与目标

  • 开发一种场景图生成器,能够明确且可解释地贡献视觉、空间和语义特征。
  • 通过解耦特征学习并分析每种模态的影响,提升视觉关系检测的性能。
  • 在 OpenImages、Visual Genome 和 VRD 等基准数据集上展示卓越性能。
  • 实现对关系预测中学习表征的更好可解释性与分析能力。
  • 为图像字幕生成和视觉问答等高层视觉-语言任务提供基础组件。

提出的方法

  • 该模型采用两阶段流程:首先,使用现成的目标检测器提取物体标签、边界框和视觉特征。
  • 三个独立分支分别处理视觉、空间和语义特征,通过求和与 Softmax 归一化实现其置信度分数的晚期融合。
  • 语义模块使用从训练数据中学得的基于频率的基线 $ p(P|S,O) $,并在其上应用残差学习。
  • 空间模块通过框差值和归一化坐标编码相对物体位置,以表示空间布局。
  • 视觉模块通过专用主干网络处理物体特征,以学习与关系相关的表征。
  • 最终预测通过求和各分支得分并应用 Softmax 得到预测谓词的概率分布。

实验结果

研究问题

  • RQ1视觉、空间和语义特征各自如何贡献于场景图生成性能?
  • RQ2采用显式分离分支的晚期融合策略是否能提升视觉关系检测中的可解释性与性能?
  • RQ3基于频率的主语-宾语对先验在多大程度上能提升关系预测的准确性?
  • RQ4空间特征与视觉特征在捕捉与关系相关的模式方面表现如何比较?
  • RQ5模块化且可解释的设计是否能在场景图生成中超越端到端融合方法?

主要发现

  • 该模型在 OpenImages 视觉关系检测挑战赛中获得第一名,在私有排行榜上相较第二名相对提升了 20%。
  • 在 OpenImages 数据集上,该模型在 100 个预测结果下的场景图检测召回率达到 28.59%,显著优于先前方法。
  • 在 Visual Genome 数据集上,该模型在场景图检测设置下,50 个预测结果下的召回率为 26.12%,100 个预测结果下为 31.28%,超越了最先进方法。
  • 在 VRD 数据集上,该模型在 COCO 预训练下达到 33.29% mAP_rel 和 41.25% mAP_phr,优于先前的最先进模型。
  • 对学习特征的可视化显示,谓词特定主干网络能有效捕捉判别性区域,如手持麦克风的手部区域。
  • 消融实验验证了包含全部三个分支及空间特征的完整模型性能最佳,证实了各组件的贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。