[论文解读] Interactive Task Planning with Language Models
本文提出 ITP(交互式任务规划),一种无需训练的框架,利用大语言模型(LLMs)如 GPT-4 实现机器人实时、交互式任务规划与重规划。该框架通过功能型 API 将高层自然语言规划与底层技能执行相结合,在零样本 dishwashing 任务中实现 100% 成功率,并能无需提示工程或微调即可稳健适应新目标。
An interactive robot framework accomplishes long-horizon task planning and can easily generalize to new goals and distinct tasks, even during execution. However, most traditional methods require predefined module design, making it hard to generalize to different goals. Recent large language model based approaches can allow for more open-ended planning but often require heavy prompt engineering or domain specific pretrained models. To tackle this, we propose a simple framework that achieves interactive task planning with language models by incorporating both high-level planning and low-level skill execution through function calling, leveraging pretrained vision models to ground the scene in language. We verify the robustness of our system on the real world task of making milk tea drinks. Our system is able to generate novel high-level instructions for unseen objectives and successfully accomplishes user tasks. Furthermore, when the user sends a new request, our system is able to replan accordingly with precision based on the new request, task guidelines and previously executed steps. Our approach is easy to adapt to different tasks by simply substituting the task guidelines, without the need for additional complex prompt engineering. Please check more details on our https://wuphilipp.github.io/itp_site and https://youtu.be/TrKLuyv26_g.
研究动机与目标
- 开发一种无需训练的交互式机器人系统,能够在任务执行过程中根据用户反馈动态重规划。
- 消除机器人任务规划中对复杂提示工程或代码级规范的依赖。
- 仅通过任务指南和预定义的底层技能 API 实现对新任务的泛化能力。
- 在真实机器人应用(如饮品制作和洗碗)中展示稳健的高层规划与执行能力。
- 创建一个灵活的开源框架,支持对多样化机器人任务的快速适应。
提出的方法
- 系统使用 GPT-4 作为高层规划器,根据用户请求和任务指南生成逐步指令。
- 将底层机器人技能抽象为基于功能语言的 API,使 LLM 能够直接调用函数,而无需代码级提示工程。
- 已完成的步骤被‘记忆’并用作重规划的上下文,使系统能够在执行过程中适应新的用户请求。
- 该框架仅依赖自然语言提示和任务指南,避免了微调或额外价值函数的需求。
- 集成视觉模型如 Grounded-DINO 以检测和定位物体,并将视觉输入输入 LLM 实现基于视觉的规划。
- 系统通过结合新用户请求、先前执行的步骤和任务指南,动态生成更新后的可执行计划。
实验结果
研究问题
- RQ1基于语言模型的系统是否能在不微调或复杂提示工程的情况下,为未见过的任务生成准确且可执行的高层计划?
- RQ2此类系统在执行过程中对用户新请求的适应能力如何,能否有效结合已完成步骤和更新后的目标?
- RQ3在仅修改任务指南和技能 API 的情况下,同一框架在不同机器人任务间的泛化能力有多大?
- RQ4当面对新颖的、零样本的物体与目标组合时,系统能否保持计划正确性和任务一致性?
- RQ5使用功能型 API 抽象底层技能对系统鲁棒性和部署便捷性有何影响?
主要发现
- 系统在零样本洗碗任务中实现了 100% 的成功率,对 27 个全新请求中的全部 27 个均生成了正确的高层计划。
- ITP 即使在指南中未明确列出的情况下,也能成功生成新型饮品配方(如芋泥奶、抹茶奶配波霸)的可执行计划。
- 系统通过准确利用已记忆的已完成步骤和更新后的目标,展示了稳健的重规划能力,能够响应执行过程中的新用户请求。
- 实现对新任务的泛化仅需更新任务指南和底层技能定义,无需修改核心规划与执行流水线。
- 该框架消除了对代码级提示工程或价值函数训练的需求,显著简化了在新任务上的部署流程。
- 系统在包括多物体、多位置洗碗请求在内的多样化复杂任务组合中,始终保持计划正确性和与真实目标的一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。