Skip to main content
QUICK REVIEW

[论文解读] Predicting Motivations of Actions by Leveraging Text

Carl Vondrick, Deniz Oktay|arXiv (Cornell University)|Jun 20, 2014
Multimodal Machine Learning Applications被引用 9
一句话总结

本文提出了预测图像中人类行为动机的任务,提出了一种利用预训练语言模型将文本中的常识知识迁移至视觉系统的方法。通过因子图模型将文本知识与视觉特征相结合,该方法在仅使用视觉的基线模型基础上显著提升了动机预测性能,证明了语言衍生的知识能够增强对人类意图的理解。

ABSTRACT

Understanding human actions is a key problem in computer vision. However, recognizing actions is only the first step of understanding what a person is doing. In this paper, we introduce the problem of predicting why a person has performed an action in images. This problem has many applications in human activity understanding, such as anticipating or explaining an action. To study this problem, we introduce a new dataset of people performing actions annotated with likely motivations. However, the information in an image alone may not be sufficient to automatically solve this task. Since humans can rely on their lifetime of experiences to infer motivation, we propose to give computer vision systems access to some of these experiences by using recently developed natural language models to mine knowledge stored in massive amounts of text. While we are still far away from fully understanding motivation, our results suggest that transferring knowledge from language into vision can help machines understand why people in images might be performing an action.

研究动机与目标

  • 为解决计算机视觉在理解人类行为'为何'执行方面的能力不足问题,而不仅限于识别'做什么'。
  • 引入一个包含10,000张图像的新数据集,标注了动作、场景和动机,用于训练和评估动机预测任务。
  • 探究大规模无标注文本中的知识是否能提升视觉模型推断人类动机的能力。
  • 开发一种融合视觉特征与语言衍生知识的框架,以实现比仅依赖视觉的方法更准确的动机预测。

提出的方法

  • 作者收集并标注了一个约10,000张图像的新数据集,包含动作、场景和动机,用于研究该问题。
  • 他们使用最先进的图像特征(如来自[41])训练视觉分类器,以预测动作和场景。
  • 他们使用在数十亿网页上预训练的大规模语言模型,提取关于人-物交互、环境和动机的文本知识。
  • 因子图模型将视觉的单变量势能与来自语言模型得分的成对势能相结合,以预测动机。
  • 该模型将视觉预测结果与语言衍生的语义关系(例如,'骑自行车通勤')整合,以优化动机预测。
  • 他们通过保留的测试集评估性能,并通过与基于维基百科的语言模型对比,分析语言知识的贡献。

实验结果

研究问题

  • RQ1计算机视觉系统能否在仅识别动作的基础上,进一步预测图像中人类行为的动机?
  • RQ2从大规模文本中挖掘的知识在多大程度上能提升视觉模型在动机预测上的准确性?
  • RQ3与仅依赖视觉的模型相比,语言衍生的常识知识整合对性能有何影响?
  • RQ4语言模型的质量(例如,网络文本 vs. 维基百科)是否显著影响动机预测的性能?
  • RQ5在图像中,哪些视觉和语言线索对预测人类动机最具预测力?

主要发现

  • 所提出的将语言衍生知识与视觉特征结合的方法,在动机预测方面显著优于仅使用视觉的基线模型。
  • 使用网络训练的语言模型比基于维基百科训练的语言模型性能提升1个百分点,表明更大、更多样化的文本数据能增强知识迁移效果。
  • 即使视觉识别对动作和场景的准确率达到完美,模型仍无法完全预测动机,表明动机与低层次视觉概念存在本质差异。
  • 模型会产生合理的失败案例,因为它利用了文本中的语义关系,表明语言知识有助于上下文推理。
  • 结果表明,仅依赖视觉特征不足以实现动机预测,外部文本衍生的常识知识对推动该领域发展至关重要。
  • 该框架表明,语言模型可作为常识知识的来源,以提升高层次视觉理解能力,尤其在诸如意图和目的等抽象概念方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。