Skip to main content
QUICK REVIEW

[论文解读] Scene Graph Reasoning for Visual Question Answering

Marcel Hildebrandt, Hang Li|arXiv (Cornell University)|Jul 2, 2020
Multimodal Machine Learning Applications参考文献 23被引用 11
一句话总结

本文提出了一种基于强化学习的视觉问答方法,通过在场景图上进行序列化、上下文驱动的推理——即对图像中对象、属性及其关系的结构化表示。通过训练智能体在场景图中导航以找到与答案相关的路径,该方法在使用人工精心构建的场景图时,于GQA数据集上实现了人类水平的性能,展现出强大的组合推理能力。

ABSTRACT

Visual question answering is concerned with answering free-form questions about an image. Since it requires a deep linguistic understanding of the question and the ability to associate it with various objects that are present in the image, it is an ambitious task and requires techniques from both computer vision and natural language processing. We propose a novel method that approaches the task by performing context-driven, sequential reasoning based on the objects and their semantic and spatial relationships present in the scene. As a first step, we derive a scene graph which describes the objects in the image, as well as their attributes and their mutual relationships. A reinforcement agent then learns to autonomously navigate over the extracted scene graph to generate paths, which are then the basis for deriving answers. We conduct a first experimental study on the challenging GQA dataset with manually curated scene graphs, where our method almost reaches the level of human performance.

研究动机与目标

  • 通过利用结构化的场景图,解决现有VQA模型缺乏显式组合推理能力的局限性。
  • 通过在场景图上进行序列化导航,实现在视觉问答中的可解释、路径驱动的推理。
  • 通过使用人工精心构建的场景图,去除目标检测和场景图生成中的噪声,独立评估推理性能。
  • 证明在复杂、偏差最小化的VQA基准(如GQA)上,基于场景图的强化学习可实现人类水平的准确率。

提出的方法

  • 该方法从图像数据构建有向多重图(即场景图),其中节点代表对象或属性,边代表语义或空间关系。
  • 添加一个中心节点,连接至图中所有其他节点,使智能体能够从图中的任意位置启动推理。
  • 智能体在场景图上执行基于策略的随机游走,根据当前状态(实体和问题)选择转移动作,动作定义为从当前节点出发的出边。
  • 使用REINFORCE算法优化智能体的策略,以最大化期望奖励,若最终节点对应正确答案,则给予1分的终端奖励。
  • 状态空间定义为场景实体与问题的笛卡尔积,智能体的目标是通过推理路径到达答案节点。
  • 该方法显式建模逆关系(例如,若A有_part B,则B是_part_of A),以确保关系推理的完整性。

实验结果

研究问题

  • RQ1与端到端神经网络相比,基于场景图的强化学习是否能在视觉问答中实现更可解释、更具组合性的推理?
  • RQ2当场景图经人工精心构建且无检测错误时,模型在推理密集型VQA基准上的表现能达到何种程度的人类水平?
  • RQ3在涉及属性、空间关系和逻辑推理的复杂视觉问题中,基于结构化场景图的序列化、多跳推理有多高效?
  • RQ4智能体生成的推理路径是否可用于调试失败案例并提升模型透明度?
  • RQ5当将该方法应用于自动生成的场景图与人工精心构建的场景图时,其性能如何变化?

主要发现

  • 在使用人工精心构建的场景图时,该方法在GQA数据集上对开放式问题达到90.41%的准确率,对二分类问题达到90.86%的准确率,总体准确率达到93.13%。
  • 该模型在关键评估指标上达到人类水平表现,包括93.68%的一致性、91.92%的有效性以及90.63%的合理性。
  • 在答案存在于场景图中的子集问题上,该方法使用最先进的方法生成的场景图时,准确率达到53.24%,优于TRRNet在相同子集上的50.22%。
  • 该模型的推理路径具有高度透明性和可解释性,相较于黑箱神经网络,更易于进行失败分析与调试。
  • 结果表明,当前性能的主要瓶颈并非推理模块本身,而是场景图生成的质量,这限制了该方法的全面部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。