[论文解读] Empowering Large Language Models on Robotic Manipulation with Affordance Prompting
本文提出 LLM+A,一种无需训练的框架,通过使用功能提示(affordance prompting)将高层计划与低层控制序列在物理现实中进行对齐,从而赋予大型语言模型(LLMs)执行机器人操作的能力。通过提示 LLM 预测动作后果并为物体分配功能值,该方法在无需微调的情况下,在多样化任务中实现了 80%-96% 的成功率,显著提升了计划的可行性与泛化能力。
While large language models (LLMs) are successful in completing various language processing tasks, they easily fail to interact with the physical world by generating control sequences properly. We find that the main reason is that LLMs are not grounded in the physical world. Existing LLM-based approaches circumvent this problem by relying on additional pre-defined skills or pre-trained sub-policies, making it hard to adapt to new tasks. In contrast, we aim to address this problem and explore the possibility to prompt pre-trained LLMs to accomplish a series of robotic manipulation tasks in a training-free paradigm. Accordingly, we propose a framework called LLM+A(ffordance) where the LLM serves as both the sub-task planner (that generates high-level plans) and the motion controller (that generates low-level control sequences). To ground these plans and control sequences on the physical world, we develop the affordance prompting technique that stimulates the LLM to 1) predict the consequences of generated plans and 2) generate affordance values for relevant objects. Empirically, we evaluate the effectiveness of LLM+A in various language-conditioned robotic manipulation tasks, which show that our approach substantially improves performance by enhancing the feasibility of generated plans and control and can easily generalize to different environments.
研究动机与目标
- 解决 LLM 由于缺乏对物理环境的物理对齐而无法生成可执行机器人控制序列的问题。
- 克服现有基于 LLM 的机器人控制方法的局限性,这些方法依赖预训练技能或需要大规模数据集进行端到端微调的模型。
- 在统一的无需训练范式下,使 LLM 同时充当高层规划者与低层运动控制器。
- 通过功能提示将 LLM 生成的计划与物理世界知识对齐,以提升其可行性与泛化能力。
- 证明 LLM 可在无需额外微调的情况下,仅通过提示推理出交互后果与任务特定的功能特性,从而实现对新环境与机器人形态的零样本迁移。
提出的方法
- 提出 LLM+A 框架,其中预训练的 LLM 作为语言条件下的机器人操作的子任务规划者与运动控制器。
- 引入功能提示,通过提示模型预测动作后果并为物体部件分配功能值,从而将 LLM 输出在物理世界中对齐。
- 使用视觉-语言模型(VLMs)提取环境观测信息,随后将这些信息与任务指令一并输入 LLM。
- 设计两阶段提示机制:第一阶段,LLM 规划子任务并预测后果;第二阶段,基于功能感知推理生成低层控制序列。
- 在多种任务与机器人(如 xArm6 和 UR5e)中使用相同的提示模板,实现对新环境与机器人类型的零样本泛化。
- 利用 LLM 中的上下文学习,无需微调即可推理空间关系、物体的功能部件与物理交互动力学。
实验结果
研究问题
- RQ1LLM 是否能通过将推理基于物理世界知识,在无需微调的情况下生成可行且可执行的机器人操作计划?
- RQ2功能提示在提升 LLM 生成计划与控制序列在真实机器人任务中可行性方面的有效性如何?
- RQ3LLM+A 在无需重新训练的情况下,能在多大程度上泛化到不同的机器人平台、环境与任务类型?
- RQ4LLM+A 的主要失败模式是什么?它们与 LLM 在功能预测与空间推理方面的局限性有何关联?
- RQ5LLM 是否能仅通过提示推理出任务特定的交互部件(如可推动与可抓取区域)及动作后果?
主要发现
- LLM+A 在 Towers-of-Hanoi-Seq 任务中达到 96% 的成功率,在 CLIPORT 的 Put-Block-in-Bowl 任务中达到 95% 的成功率,表明其在复杂操作任务中表现强劲。
- 该框架在 CLIPORT 的五项异构任务中实现了平均 85% 的成功率,显示出对不同机器人(UR5e)与夹持器(真空吸附与末端执行器)的稳健零样本泛化能力。
- 失败分析表明,仅有 4% 的失败源于任务规划,说明在通过功能提示实现对齐后,LLM 在高层推理方面极为高效。
- 最常见的失败模式为功能预测(13%)与运动控制(13%),尤其在涉及复杂物体交互的任务(如 Block-to-Block)中更为明显。
- LLM+A 显著降低了对预训练技能或微调策略的依赖,提供了一种无需训练的替代方案,缓解了机器人领域的数据瓶颈问题。
- 可视化示例显示,LLM 正确地为物理相关部件(如汉诺塔中的顶部环)分配了更高的功能值,证实功能提示能够实现物理推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。