[论文解读] Lifelong Robot Learning with Human Assisted Language Planners
本文提出了一种终身机器人学习框架,其中大型语言模型(LLMs)通过人机协作的语言规划动态请求并获取新的6-DoF操作技能。通过整合神经描述符场(NDFs)实现数据高效的技能学习,该系统使LLMs能够实时扩展其技能库,并在使用docstrings描述时实现75%的技能复用成功率。
Large Language Models (LLMs) have been shown to act like planners that can decompose high-level instructions into a sequence of executable instructions. However, current LLM-based planners are only able to operate with a fixed set of skills. We overcome this critical limitation and present a method for using LLM-based planners to query new skills and teach robots these skills in a data and time-efficient manner for rigid object manipulation. Our system can re-use newly acquired skills for future tasks, demonstrating the potential of open world and lifelong learning. We evaluate the proposed framework on multiple tasks in simulation and the real world. Videos are available at: https://sites.google.com/mit.edu/halp-robot-learning.
研究动机与目标
- 使基于LLM的机器人规划器能够在现实场景中动态请求并学习新的操作技能,克服固定技能库的局限性。
- 解决获取新机器人技能时的数据与时间效率低下问题,特别是针对如侧向抓取或堆叠物体等复杂6-DoF动作。
- 开发一种可在未来任务中复用新获取技能的系统,实现在机器人领域的开放世界与终身学习。
- 将人类反馈整合到技能获取循环中,以提高规划准确性和任务成功率,同时尽量减少对持续人类干预的依赖。
提出的方法
- 该系统使用一个LLM规划器,接收自然语言任务描述、来自感知系统的场景描述以及现有技能库(作为Python函数),并生成可执行代码形式的计划。
- 向LLM暴露一个特殊的“learn_skill”函数,使其在现有技能不足时可请求新技能,返回技能名称和描述性docstring。
- 新技能通过神经描述符场(NDFs)实现,仅需5–10次示范即可学习6-DoF刚体操作策略。
- 示范完成后,新学习到的技能被添加到技能库中,并可在未来任务中复用。
- LLM利用技能的docstring进行推理,通过上下文定位提升规划准确性。
- 人类反馈用于验证任务成功并指导技能获取,但系统旨在随时间减少对这类反馈的依赖。

实验结果
研究问题
- RQ1基于LLM的规划器是否能在真实机器人环境中动态请求并学习新的6-DoF操作技能?
- RQ2NDFs的集成在终身学习设置中是否能有效实现数据高效且快速的技能获取?
- RQ3LLM在多大程度上能正确复用新获取的技能?技能描述质量对此有何影响?
- RQ4当引入新技能时,基于LLM的规划可能出现哪些失败模式?这些失败如何影响下游任务执行?
主要发现
- 该系统成功实现了基于LLM的规划器在仿真和真实世界环境中,仅通过5–10次示范使用NDFs动态请求并学习新操作技能。
- 当新技能同时提供名称和docstring时,LLM在后续任务中正确复用这些技能的成功率达到75%。
- 当仅提供技能名称时,成功率下降至50%,凸显了上下文描述在LLM推理中的重要性。
- LLM常因不恰当地调用新学习的技能或在名称稍有不同时重复学习同一技能,表明其在技能适用性推理方面存在局限。
- 感知系统提供的场景描述不准确会显著影响规划性能,表明系统对输入质量高度敏感。
- 人类反馈对任务成功验证和技能获取至关重要,但反复依赖会限制自主性——提示需要引入学习的成功检测器以提升可扩展性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。