Skip to main content
QUICK REVIEW

[论文解读] What is not where: the challenge of integrating spatial representations into deep learning architectures

John D. Kelleher, Simon Dobnik|arXiv (Cornell University)|Jul 21, 2018
Multimodal Machine Learning Applications参考文献 38被引用 8
一句话总结

本文批评了当前深度学习图像字幕模型在视觉几何中未能有效定位空间语言,尽管其在生成空间介词方面表现优异。尽管模型依赖分布语言模型基于名词共现来预测介词,但缺乏显式的几何推理,导致字幕仅捕捉图像中‘有什么’,而未捕捉‘物体位于何处’。

ABSTRACT

This paper examines to what degree current deep learning architectures for image caption generation capture spatial language. On the basis of the evaluation of examples of generated captions from the literature we argue that systems capture what objects are in the image data but not where these objects are located: the captions generated by these systems are the output of a language model conditioned on the output of an object detector that cannot capture fine-grained location information. Although language models provide useful knowledge for image captions, we argue that deep learning image captioning architectures should also model geometric relations between objects.

研究动机与目标

  • 探究当前深度学习图像字幕架构是否能有效将空间语言与视觉感知相联系。
  • 分析现有编码器-解码器CNN-RNN架构在捕捉物体之间几何关系方面的局限性。
  • 评估生成字幕中的空间介词在多大程度上基于实际空间推理,而非统计共现模式。
  • 识别视觉-语言模型中对象身份与空间位置语义定位之间的差距。
  • 提出未来方向,将几何表征整合到深度学习架构中,以提升图像字幕中的空间推理能力。

提出的方法

  • 评估最先进模型生成的图像字幕,以评估空间语言的准确性和定位性。
  • 分析RNN语言模型在基于训练语料中名词与介词共现模式预测空间介词中的作用。
  • 检查CNN的对象检测输出作为语言模型主要输入,但其空间定位保真度有限。
  • 利用分布语义建模语言模型如何在缺乏几何意识的情况下间接捕捉物体之间的功能关系。
  • 将空间描述中的语言模式与图像中的实际空间构型进行比较,以评估定位保真度。
  • 探索神经网络的模块化设计(如Andreas et al. 2016;Johnson et al. 2017)作为整合几何推理的潜在路径。

实验结果

研究问题

  • RQ1当前深度学习图像字幕模型在多大程度上捕捉了图像中物体的空间位置?
  • RQ2语言模型在缺乏显式几何推理的情况下,如何促成空间介词的生成?
  • RQ3为何模型在缺乏细粒度空间定位的情况下仍能生成看似合理的空间描述?
  • RQ4语料中词语共现模式在空间语言生成的表面成功中起到何种作用?
  • RQ5能否有效将几何表征整合到现有深度学习架构中用于图像字幕?

主要发现

  • 当前图像字幕模型生成的空间描述在统计上看似合理,但并未基于实际的空间几何。
  • 模型依赖分布语言模型基于名词共现来预测介词,而非基于视觉空间推理。
  • 像‘left of’或‘behind’这样的空间介词是基于统计可能性而非物体的实际几何构型生成的。
  • CNN组件能检测到物体,但无法保留生成准确空间描述所必需的细粒度空间关系。
  • 尽管缺乏几何意识,模型仍因语言模型中强大的分布先验而实现了在空间语言生成方面的高性能。
  • 在对象身份定位(由CNN捕捉)与空间位置定位(当前架构未捕捉)之间存在根本性脱节。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。