Skip to main content
QUICK REVIEW

[论文解读] Few-shot Object Grounding and Mapping for Natural Language Robot Instruction Following

Valts Blukis, Ross A. Knepper|arXiv (Cornell University)|Nov 14, 2020
Multimodal Machine Learning Applications参考文献 45被引用 6
一句话总结

本文提出了一种少样本语言条件下的物体定位与建图方法,用于机器人中的自然语言指令遵循,使四旋翼飞行器能够通过仅添加少量示例图像和描述,推理从未见过的物体。该方法在人类评估中相比先前最先进方法实现了27%的绝对性能提升,即使这些模型在所有物体上进行了训练。

ABSTRACT

We study the problem of learning a robot policy to follow natural language instructions that can be easily extended to reason about new objects. We introduce a few-shot language-conditioned object grounding method trained from augmented reality data that uses exemplars to identify objects and align them to their mentions in instructions. We present a learned map representation that encodes object locations and their instructed use, and construct it from our few-shot grounding output. We integrate this mapping approach into an instruction-following policy, thereby allowing it to reason about previously unseen objects at test-time by simply adding exemplars. We evaluate on the task of learning to map raw observations and instructions to continuous control of a physical quadcopter. Our approach significantly outperforms the prior state of the art in the presence of new objects, even when the prior approach observes all objects during training.

研究动机与目标

  • 使机器人能够在不重新训练或微调的情况下,遵循涉及从未见过物体的自然语言指令。
  • 通过可学习的、以物体为中心的地图,解耦感知与推理,从而降低模块化指令遵循系统的工程与集成开销。
  • 设计一种少样本定位机制,利用增强现实数据,通过示例泛化至不同类型的物体。
  • 构建一种学习得到的地图表示,编码物体位置及其在指令中的用途,通过数据库扩展实现对新物体的推理。

提出的方法

  • 该方法使用在合成增强现实(AR)数据上训练的少样本定位组件,通过示例数据库将指令中的自然语言提及与视觉物体对齐。
  • 通过基于相似度的模型执行物体定位,将语言提及与存储的物体外观和名称示例进行比较,无需针对每个物体进行训练。
  • 从定位输出构建一种学习得到的地图表示,编码物体位置及其在指令中的角色,支持以物体为中心的推理。
  • 在仿真环境中端到端训练策略,采用SuReAL,第一阶段结合监督学习,第二阶段使用PPO进行强化学习。
  • 在监督学习与强化学习过程之间共享数据,提升策略鲁棒性并防止退化行为。
  • 定位组件可直接从基于模拟器的AR数据切换至真实世界的AR数据,无需领域自适应,支持在物理四旋翼飞行器上直接部署。

实验结果

研究问题

  • RQ1机器人策略是否能在不重新训练或微调的情况下,泛化至自然语言指令遵循中未见过的物体类型?
  • RQ2在真实环境中,使用示例的少样本定位机制在推理未见物体方面的有效性如何?
  • RQ3一种编码物体位置和指令用途的学习地图表示是否能提升指令遵循任务中的零样本泛化能力?
  • RQ4将少样本定位集成到策略架构中是否优于需要完整训练数据覆盖的端到端学习方法?
  • RQ5当在完全未见过的物体环境中测试时,所提方法在多大程度上超越先前最先进模型?

主要发现

  • 当泛化至新物体时,所提方法在人类评估中相比先前最先进方法实现了27%的绝对性能提升。
  • 该模型在人类评估中比在测试环境中所有63个物体上都进行过训练的基线模型高出10%,证明了其卓越的零样本泛化能力。
  • 通过仅向数据库中添加少量示例图像和描述,系统即可成功遵循涉及从未见过物体的指令,无需额外训练。
  • 通过在定位模块中将AR数据源从模拟器替换为真实世界数据,策略可有效从仿真泛化至真实世界,无需领域自适应或真实世界微调。
  • 监督学习与强化学习阶段之间的数据共享机制可防止退化行为并提升策略鲁棒性。
  • 该方法在物理四旋翼飞行器上的真实世界部署中保持了高性能,证实了基于AR的训练与迁移策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。