Skip to main content
QUICK REVIEW

[论文解读] Sim-to-Real Transfer for Vision-and-Language Navigation

Peter Anderson, Ayush Shrivastava|arXiv (Cornell University)|Nov 7, 2020
Multimodal Machine Learning Applications参考文献 47被引用 21
一句话总结

本论文首次实现了在模拟环境中训练的视觉-语言导航(VLN)智能体从仿真到真实机器人环境的端到端迁移,采用子目标模型将离散的模拟动作与连续的机器人控制相衔接。在预采集地图和图谱的条件下,机器人实现了46.8%的成功率,仅比模拟环境中的表现低9.1%,证明了迁移的可行性;但在无地图的冷启动场景下,性能下降至22.5%,主要由于子目标预测错误。

ABSTRACT

We study the challenging problem of releasing a robot in a previously unseen environment, and having it follow unconstrained natural language navigation instructions. Recent work on the task of Vision-and-Language Navigation (VLN) has achieved significant progress in simulation. To assess the implications of this work for robotics, we transfer a VLN agent trained in simulation to a physical robot. To bridge the gap between the high-level discrete action space learned by the VLN agent, and the robot's low-level continuous action space, we propose a subgoal model to identify nearby waypoints, and use domain randomization to mitigate visual domain differences. For accurate sim and real comparisons in parallel environments, we annotate a 325m2 office space with 1.3km of navigation instructions, and create a digitized replica in simulation. We find that sim-to-real transfer to an environment not seen in training is successful if an occupancy map and navigation graph can be collected and annotated in advance (success rate of 46.8% vs. 55.9% in sim), but much more challenging in the hardest setting with no prior mapping at all (success rate of 22.5%).

研究动机与目标

  • 评估在模拟环境中训练的VLN智能体是否能成功在真实世界环境中根据自然语言指令导航。
  • 解决由于模拟环境中离散动作空间与真实世界连续控制之间的差异所导致的仿真到真实环境的差距问题。
  • 研究在低成本真实机器人上使用经典导航栈部署学习到的VLN智能体的可行性。
  • 评估先验环境地图(占用地图与导航图)对仿真到真实环境迁移性能的影响。
  • 识别在无先验环境知识的冷启动场景下,仿真到真实迁移中的主要失败模式。

提出的方法

  • 训练一个子目标模型,从360° RGB图像和激光扫描中预测附近的可导航目标点,从而实现从高层VLN动作到低层机器人控制的映射。
  • 在VLN智能体和子目标模型的训练过程中应用领域随机化,以减少仿真与真实环境之间的视觉域差异。
  • 使用基于ROS的经典导航栈,集成SLAM、障碍物避让与路径规划功能,实现真实环境下的机器人运行。
  • 使用Matterport相机对一个325平方米的真实办公环境(Coda)进行扫描,并将其数字化为Matterport3D模拟器,用于并行的仿真到真实评估。
  • 通过Amazon Mechanical Turk收集了111条自然语言导航指令,构建了真实与模拟环境中配对的语言-轨迹数据集。
  • 采用两种评估设置:'带地图'(预先收集的占用地图与导航图)和'无地图'(机器人每轮任务从零开始执行SLAM)。

实验结果

研究问题

  • RQ1在未见过的真实世界环境中,基于非约束性自然语言指令,能否成功实现模拟训练的VLN智能体导航?
  • RQ2预先收集的环境地图的存在与否如何影响仿真到真实环境的迁移性能?
  • RQ3在无先验地图知识的场景下,仿真到真实迁移的主要失败模式是什么?
  • RQ4视觉域差异与视角差异在真实部署中对性能下降的贡献程度如何?
  • RQ5子目标模型是否能有效弥合模拟环境中离散动作与真实机器人连续控制之间的动作空间差距?

主要发现

  • 在预收集的占用地图与导航图支持下,机器人在遵循自然语言指令时的成功率达到46.8%,而模拟环境中的成功率为55.9%,性能下降9.1%。
  • 这9.1%的性能下降中,3.9%归因于视觉域差异,5.2%归因于模拟与真实环境之间的视角差异。
  • 在'无地图'冷启动设置下,机器人需从零开始执行SLAM且无任何先验环境知识,成功率下降至22.5%。
  • 该设置下失败的主要原因是子目标模型的预测错误,包括误报(如导航至螺旋楼梯)和漏报(如遗漏家具之间的狭窄通道)。
  • 在'无地图'设置下,真实与模拟环境中的轨迹相似性最低,NDTW得分仅为0.33,表明导航路径存在显著偏差。
  • 研究结论认为,在冷启动场景下,仿真到真实环境的迁移仍是一个开放的研究问题,主要受限于子目标预测不准确与动作空间不匹配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。