Skip to main content
QUICK REVIEW

[论文解读] Grounding Spatio-Semantic Referring Expressions for Human-Robot Interaction

Mohit Shridhar, David Hsu|arXiv (Cornell University)|Jul 18, 2017
Multimodal Machine Learning Applications参考文献 38被引用 16
一句话总结

本文提出了一种用于在人机交互中定位非受限时空语义指代表达的两阶段神经网络流水线,利用预训练的图像字幕模型首先识别语义相关的物体,然后根据空间关系选择正确的物体。该系统在RefCOCO基准上实现了最先进性能,并实现了通过自然语言指令进行语音控制的拾取与放置未见过的物体。

ABSTRACT

The human language is one of the most natural interfaces for humans to interact with robots. This paper presents a robot system that retrieves everyday objects with unconstrained natural language descriptions. A core issue for the system is semantic and spatial grounding, which is to infer objects and their spatial relationships from images and natural language expressions. We introduce a two-stage neural-network grounding pipeline that maps natural language referring expressions directly to objects in the images. The first stage uses visual descriptions in the referring expressions to generate a candidate set of relevant objects. The second stage examines all pairwise relationships between the candidates and predicts the most likely referred object according to the spatial descriptions in the referring expressions. A key feature of our system is that by leveraging a large dataset of images labeled with text descriptions, it allows unrestricted object types and natural language referring expressions. Preliminary results indicate that our system outperforms a near state-of-the-art object comprehension system on standard benchmark datasets. We also present a robot system that follows voice commands to pick and place previously unseen objects.

研究动机与目标

  • 使机器人能够理解并执行对非结构化环境中物体的非受限自然语言描述。
  • 解决在不依赖预定义物体类别或空间模板的情况下,对指代表达中的语义和空间属性进行定位的挑战。
  • 开发一种仅使用图像和文本数据即可泛化到未见过的物体和空间配置的系统。
  • 在真实世界的人机交互场景中,通过语音命令演示端到端的物体检索与操作。

提出的方法

  • 该系统使用预训练的图像字幕模型从图像中生成视觉描述,基于指代表达中的语义内容生成候选物体区域。
  • 第二个字幕模型在时空描述(例如“左边的瓶子”)上进行微调,以预测候选物体之间的空间关系。
  • 该流水线结合卷积神经网络(CNN)的视觉特征和长短期记忆网络(LSTM)的语言特征,将图像和文本输入嵌入到联合嵌入空间中。
  • 通过使用学习到的相似性函数对所有候选物体对进行排序,实现空间定位,选择与空间描述最匹配的一对。
  • 最终输出为最可能被指代物体的2D边界框,由排名最高的物体对推导得出。
  • 该系统部署在6自由度的MICO机械臂上,结合语音转文本识别和简单的抓取规划器,执行拾取与放置任务。

实验结果

研究问题

  • RQ1是否可以仅通过基于图像的、端到端的神经流水线,在不预设物体类别的情况下,对自由形式、开放词汇的指代表达进行定位?
  • RQ2与现有方法相比,两阶段字幕模型架构在时空语义表达定位任务上的表现如何?
  • RQ3该系统能否泛化到训练过程中未见过的新物体和空间配置?
  • RQ4该系统在真实世界人机交互中,对自然、非受限语言的有效性如何?

主要发现

  • 所提出的系统在RefCOCO时空语义定位基准上优于最先进方法UMD RefExp模型。
  • 该系统通过结合预训练字幕模型的视觉和语义先验,成功定位并检索了未见过的物体,例如“橙色的杯子”。
  • 在包含10–20个物体的非杂乱场景中,语音到动作执行的平均端到端延迟为2–5秒。
  • 在非正式用户研究中,用户满意度较高,用户能够通过简单自然的语言可靠地传达物体意图。
  • 当指代表达中包含少于四种物体类型且仅含一个或无空间关系时,定位流水线的准确性最高。
  • 在存在复杂嵌套空间关系(例如“在X的右边且在Y的左边”)时,系统会出现失败案例,表明其在建模多跳空间推理方面存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。