Skip to main content
QUICK REVIEW

[论文解读] The RobotSlang Benchmark: Dialog-guided Robot Localization and Navigation

Shurjo Banerjee, Jesse Thomason|arXiv (Cornell University)|Oct 23, 2020
Speech and dialogue systems被引用 8
一句话总结

本文提出了RobotSlang,一个包含169段人类-人类对话会话的真实世界基准,涉及使用自然语言进行物理机器人定位与导航。该研究提出了两个任务——基于对话历史的定位(LDH)和基于对话历史的导航(NDH),并证明了在真实世界对话和视觉数据上训练的序列到序列模型能够成功引导物理机器人,其性能优于基线模型,并在使用教师强制训练时表现出更强的鲁棒性。

ABSTRACT

Autonomous robot systems for applications from search and rescue to assistive guidance should be able to engage in natural language dialog with people. To study such cooperative communication, we introduce Robot Simultaneous Localization and Mapping with Natural Language (RobotSlang), a benchmark of 169 natural language dialogs between a human Driver controlling a robot and a human Commander providing guidance towards navigation goals. In each trial, the pair first cooperates to localize the robot on a global map visible to the Commander, then the Driver follows Commander instructions to move the robot to a sequence of target objects. We introduce a Localization from Dialog History (LDH) and a Navigation from Dialog History (NDH) task where a learned agent is given dialog and visual observations from the robot platform as input and must localize in the global map or navigate towards the next target object, respectively. RobotSlang is comprised of nearly 5k utterances and over 1k minutes of robot camera and control streams. We present an initial model for the NDH task, and show that an agent trained in simulation can follow the RobotSlang dialog-based navigation instructions for controlling a physical robot platform. Code and data are available at https://umrobotslang.github.io/.

研究动机与目标

  • 通过创建基于真实人机交互的数据集,弥合基于模拟的视觉-语言导航基准与真实世界机器人部署之间的差距。
  • 研究人类在真实环境中如何自然地通过自然语言协作实现对机器人的定位与导航。
  • 利用来自物理机器人平台的真实世界传感器数据和对话数据,开发并评估基于学习的对话引导导航模型。
  • 通过利用从物理实验中收集的人类生成对话数据,实现样本高效且鲁棒的物理机器人控制训练。
  • 提供一个支持从模拟到真实世界部署迁移学习的基准,减少对昂贵真实世界数据收集的依赖。

提出的方法

  • 收集169段人类-人类对话会话,其中一名参与者(驾驶员)通过树莓派和高清网络摄像头控制一台物理机器人,另一名参与者(指挥员)通过基于网络的聊天界面提供导航指令。
  • 同步并标注原始对话、机器人摄像头画面、控制指令和全局地图,创建一个多模态数据集,包含近5,000条话语和超过1,000分钟的传感器数据。
  • 定义两个基准任务:基于对话历史的定位(LDH),即代理需利用对话和视觉输入在全局地图上定位机器人;以及基于对话历史的导航(NDH),即代理需根据对话历史导航至目标物体。
  • 使用视觉观察(RGB摄像头画面)和对话历史作为输入,对NDH任务训练一个序列到序列模型,并以真实导航路径作为监督信号。
  • 在训练过程中应用教师强制策略以提升推理阶段的鲁棒性,并使用拓扑距离(TD)作为主要评估指标。
  • 通过移除视觉或语言模态进行消融研究,以评估单模态性能并识别潜在的模态偏差。

实验结果

研究问题

  • RQ1仅使用对话历史和来自物理机器人平台的视觉观察,学习到的代理能否准确地在全局地图上定位机器人?
  • RQ2在人类生成的对话和真实世界传感器数据上训练的模型,能否成功通过自然语言指令引导物理机器人导航至目标物体?
  • RQ3与单模态基线相比,同时包含视觉和语言模态在对话引导导航中的表现有何提升?
  • RQ4与教师强制训练相比,使用教师强制训练是否能提升真实世界导航任务中的泛化能力和鲁棒性?
  • RQ5当在真实人类-机器人对话数据上微调后,基于模拟数据训练的模型在多大程度上能泛化到真实世界机器人控制?

主要发现

  • NDH模型优于随机动作和立即停止基线模型,在教师强制训练下,平均拓扑距离(TD)为3.27 ± 1.21米,显著优于随机基线(4.31 ± 1.28米)。
  • 同时包含视觉和语言输入的完整模型性能显著优于单模态消融实验,视觉+语言与仅视觉的比较p值<0.05,表明两种模态具有互补作用。
  • 训练期间使用教师强制策略可提升推理阶段的鲁棒性,完整模型在教师强制下达到TD 3.27 ± 1.28米,而教师强制下为3.42 ± 1.06米。
  • 仅视觉的模型性能与完整模型相比无显著差异,表明视觉本身已捕捉到大量导航线索,但语言在消除歧义方面至关重要。
  • 同时具备视觉和语言输入的模型在统计上优于两种单模态模型,其TD为3.68 ± 1.28米,而仅语言为3.76 ± 1.61米,仅视觉为3.67 ± 1.56米。
  • Oracle停止基线(选择最佳中间路径点)的TD为3.16 ± 1.50米,表明模型性能仍低于理论最优路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。