Skip to main content
QUICK REVIEW

[论文解读] Answering Visual What-If Questions: From Actions to Predicted Scene Descriptions

Misha Wagner, Hector Basevi|arXiv (Cornell University)|Sep 11, 2018
Multimodal Machine Learning Applications参考文献 24被引用 11
一句话总结

本文提出视觉假设性问题(WIQ)回答这一新任务,将视觉问答与基于物理的未来场景状态预测相结合。作者提出一种混合模型,整合物理引擎与数据驱动的问答架构,在新构建的桌面交互数据集(TIWIQ)上,相较于端到端学习基线模型,显著提升了性能,尤其在生成准确、与动作相关的场景描述方面表现优异。

ABSTRACT

In-depth scene descriptions and question answering tasks have greatly increased the scope of today's definition of scene understanding. While such tasks are in principle open ended, current formulations primarily focus on describing only the current state of the scenes under consideration. In contrast, in this paper, we focus on the future states of the scenes which are also conditioned on actions. We posit this as a question answering task, where an answer has to be given about a future scene state, given observations of the current scene, and a question that includes a hypothetical action. Our solution is a hybrid model which integrates a physics engine into a question answering architecture in order to anticipate future scene states resulting from object-object interactions caused by an action. We demonstrate first results on this challenging new problem and compare to baselines, where we outperform fully data-driven end-to-end learning approaches.

研究动机与目标

  • 填补视觉推理中仅限于静态场景理解、缺乏对假设性动作条件下的未来状态预测的空白。
  • 形式化定义一项新任务——视觉假设性问题回答,即模型需基于当前观测与假设性动作描述未来场景状态。
  • 构建首个用于桌面物体交互的标注数据集TIWIQ,包含动作条件化的未来场景描述。
  • 设计并评估一种混合模型,利用物理引擎实现精确的物理推理,同时借助神经网络完成语言对齐与答案生成。
  • 证明基于模型的物理模拟相比纯数据驱动方法,能提升长时序、定性未来预测的泛化能力与准确性。

提出的方法

  • 模型采用问答框架,输入包括当前场景的图像和包含假设性动作的自然语言问题。
  • 对动作进行解析,提取动作类型、作用对象及动作参数,用于驱动物理引擎模拟物体交互。
  • 物理引擎基于物理定律模拟物体轨迹与交互,生成场景的预测未来状态。
  • 神经网络组件基于物理模拟结果与输入问题,生成对预测结果的自然语言描述。
  • 系统通过弱监督方式端到端训练,利用真实描述作为监督信号,损失函数针对BLEU、CIDEr、ROUGE与COM指标进行优化。
  • 混合架构通过依赖物理模拟而非记忆训练样本,实现对未见动作与物体配置的泛化能力。

实验结果

研究问题

  • RQ1模型能否准确预测在桌面环境中,由假设性动作引发的定性未来场景状态?
  • RQ2与纯数据驱动模型相比,集成物理引擎在视觉问答中如何提升零样本泛化与推理能力?
  • RQ3混合模型在生成与人类直觉及真实情况一致的未来物体交互自然语言描述方面,能达到何种程度?
  • RQ4模型各组件(动作类型、物体、参数)对最终预测质量的贡献如何?
  • RQ5当涉及长期物理交互时,模型能否泛化到训练中未见的物体配置与动作,尤其是新组合?

主要发现

  • 混合模型在所有评估指标上均优于纯数据驱动基线,BLEU得分为0.283,CIDEr为1.133,ROUGE为0.424,COM为0.673。
  • 添加真实动作参数使性能提升最显著,BLEU从0.262提升至0.272,COM从0.640提升至0.662。
  • 与数据驱动基线相比,模型生成的描述更准确、更一致,在80%的案例中正确识别出因果主体(如“螺丝刀推动芥末容器”)。
  • 在无交互发生的情况下,混合模型100%正确预测“无变化”,而数据驱动模型常出现幻觉式错误交互。
  • 模型对未见物体配置与动作表现出强鲁棒性,通过基于物理的模拟实现泛化,而非记忆训练样本。
  • 人类基线与模型预测在定性结果上高度一致,混合模型在6个测试案例中的5个中与人类推理高度吻合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。