Skip to main content
QUICK REVIEW

[论文解读] Foundation Model based Open Vocabulary Task Planning and Executive System for General Purpose Service Robots

Yoshiki Obinata, Naoaki Kanazawa|arXiv (Cornell University)|Aug 7, 2023
Robotics and Automated SystemsEngineering被引用 3
一句话总结

本文提出了一种基于基础模型的开放词汇任务规划与执行系统,适用于通用服务机器人,通过将大型语言模型(LLMs)和视觉语言模型(VLMs)与状态机执行器相结合,实现在真实环境中对口语指令的稳健、稳定执行。该系统在2022年RoboCup@home日本公开赛GPSR比赛中获得第一名,得分130分,显著优于其他参赛队伍。

ABSTRACT

This paper describes a strategy for implementing a robotic system capable of performing General Purpose Service Robot (GPSR) tasks in robocup@home. The GPSR task is that a real robot hears a variety of commands in spoken language and executes a task in a daily life environment. To achieve the task, we integrate foundation models based inference system and a state machine task executable. The foundation models plan the task and detect objects with open vocabulary, and a state machine task executable manages each robot's actions. This system works stable, and we took first place in the RoboCup@home Japan Open 2022's GPSR with 130 points, more than 85 points ahead of the other teams.

研究动机与目标

  • 使通用服务机器人能够在日常生活环境中理解并执行多样化的口语指令。
  • 解决利用基础模型实现开放词汇理解与动作规划的挑战。
  • 通过基于状态机的执行系统确保机器人行为的稳定与确定性,即使在出现故障或歧义时亦然。
  • 通过人类反馈与迭代优化,整合本地环境知识并处理故障。
  • 通过结合LLMs、VLMs与可执行状态机,提升真实环境中执行的鲁棒性。

提出的方法

  • 系统使用大型语言模型(GPT-3)将口语指令解析为一系列原始动作序列。
  • 视觉语言模型(OFA、Detic)实现开放词汇的对象检测与视觉问答。
  • 状态机任务执行器管理动作序列,每个原始函数的成功或失败均触发确定性状态转换。
  • 原始函数包括 move_to、grasp、follow、pass_to、speak、answer 和 visual_question_answering。
  • 通过自然语言描述环境(如物体位置与空间关系)将本地知识注入LLM。
  • 故障处理包括重试动作、向人类寻求指导,并利用反馈改进未来执行。

实验结果

研究问题

  • RQ1如何有效结合基础模型与基于状态机的执行器,以实现在开放词汇、真实世界任务中稳定且确定的机器人行为?
  • RQ2LLMs与VLMs能否协同实现对日常环境中复杂自然语言指令的鲁棒开放词汇理解?
  • RQ3如何有效将本地环境知识(如物体位置与空间布局)整合到基础模型的推理过程中?
  • RQ4在原始函数不可预测失败时,应采用何种机制以改善故障检测与恢复?
  • RQ5在真实世界服务机器人竞赛中,基础模型与状态机的混合系统在多大程度上优于传统的基于规则或仅依赖学习的方法?

主要发现

  • 所提出的系统在2022年RoboCup@home日本公开赛GPSR比赛中获得第一名,总得分为130分。
  • 系统得分比第二名高出85分以上,表明其在开放词汇任务执行方面具有显著优越性能。
  • LLMs用于任务规划、VLMs用于视觉理解的整合,实现了鲁棒的开放词汇对象检测与语言定位。
  • 状态机执行器确保了确定性行为,提升了任务执行过程中出现故障时的稳定性与可靠性。
  • 当原始函数失败时,系统通过提示用户澄清来有效处理模糊或不完整的指令。
  • 研究人员识别出检测细微故障(如抓取过程中物体掉落)的关键挑战,并强调需要改进反馈机制与数据收集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。