[论文解读] Interactive Visual Grounding of Referring Expressions for Human-Robot Interaction
INGRESS 是一种基于神经网络的系统,用于在人机交互中实现自然语言指代表达的交互式视觉定位。它采用两阶段方法——首先生成视觉描述以识别候选对象,然后分析成对关系以解决歧义——在 RefCOCO 数据集上实现了最先进性能,并在实验中展现出更优的人机交互质量。
This paper presents INGRESS, a robot system that follows human natural language instructions to pick and place everyday objects. The core issue here is the grounding of referring expressions: infer objects and their relationships from input images and language expressions. INGRESS allows for unconstrained object categories and unconstrained language expressions. Further, it asks questions to disambiguate referring expressions interactively. To achieve these, we take the approach of grounding by generation and propose a two-stage neural network model for grounding. The first stage uses a neural network to generate visual descriptions of objects, compares them with the input language expression, and identifies a set of candidate objects. The second stage uses another neural network to examine all pairwise relations between the candidates and infers the most likely referred object. The same neural networks are used for both grounding and question generation for disambiguation. Experiments show that INGRESS outperformed a state-of-the-art method on the RefCOCO dataset and in robot experiments with humans.
研究动机与目标
- 使机器人能够在真实环境中理解非受限的自然语言指令以执行物体操作。
- 通过在人机交互过程中动态提问,解决指代表达中的歧义。
- 支持开放词汇的对象类别和自由形式的语言表达,无需预定义模板。
- 通过语言生成与消歧机制,提升定位准确率与人机沟通质量。
- 开发一种可在多样化、未见过的物体及复杂空间关系中泛化的系统,适用于简洁场景。
提出的方法
- 使用基于 Faster R-CNN 的定位模块,从 RGB-D 图像中生成物体候选区域。
- 应用两阶段神经网络:第一阶段使用 LSTM 从图像区域生成语言表达,并与输入的指代表达匹配,以识别候选对象。
- 第二阶段使用另一 LSTM 生成所有候选对象对之间的关系描述,并与输入的关系表达进行比较,以推断被指代的对象。
- 利用相同的神经网络同时完成定位与生成消歧问题,实现交互式消歧。
- 在 Kinova Mico 机器人上集成语音输入与 RGB-D 感知,实现实验室环境下的部署。
- 采用关键词匹配与视角感知的语言建模方法,处理用户中心视角的表达,如“在我的左边”。
实验结果
研究问题
- RQ1神经网络系统能否在开放词汇、真实世界环境中有效实现非受限指代表达的视觉定位?
- RQ2机器人如何通过动态生成问题,实现对自然语言指令中歧义的实时消解?
- RQ3与传统基于分类的方法相比,通过生成实现的定位在准确率与人机沟通质量方面提升程度如何?
- RQ4能否使用相同的神经组件同时完成定位与消歧,从而实现统一的系统架构?
- RQ5用户在交互式定位场景中如何感知并响应机器人生成的问题?
主要发现
- INGRESS 在 RefCOCO 测试数据集上的表现优于最先进方法 UMD Refexp,显示出更高的定位准确率。
- 在人机交互实验中,INGRESS 在有效消歧沟通方面的平均评分为 4.4(5 分制),显著高于基线的 1.6(p < 0.001)。
- 约 79% 的用户回应与机器人的语言风格保持一致,表明人机之间存在语言适应现象。
- 在 80% 的歧义情形中,系统成功生成了清晰且具有区分度的问题,失败主要源于遮挡或复杂关系(如“第三个”或“全部四个”)。
- 机器人的指向手势在仅靠语言问题无法完全区分的情形中显著提升了消歧效果。
- 参与者经常调整自身语言以匹配机器人的表达方式,表明机器人的语言风格会影响人类的沟通模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。