[论文解读] CAPE: Corrective Actions from Precondition Errors using Large Language Models
CAPE 是一种重新提示(re-prompting)框架,利用前提条件错误反馈来指导大型语言模型(LLMs)在任务规划期间对失败动作生成纠正措施。通过模板化提示注入失败上下文,CAPE 提升了计划的可执行性和正确性,在 VirtualHome 中实现了 49.63% 的计划正确率,并在 Boston Dynamics Spot 机器人上相比 SayCan 提高了 76.49%。
Extracting commonsense knowledge from a large language model (LLM) offers a path to designing intelligent robots. Existing approaches that leverage LLMs for planning are unable to recover when an action fails and often resort to retrying failed actions, without resolving the error's underlying cause. We propose a novel approach (CAPE) that attempts to propose corrective actions to resolve precondition errors during planning. CAPE improves the quality of generated plans by leveraging few-shot reasoning from action preconditions. Our approach enables embodied agents to execute more tasks than baseline methods while ensuring semantic correctness and minimizing re-prompting. In VirtualHome, CAPE generates executable plans while improving a human-annotated plan correctness metric from 28.89% to 49.63% over SayCan. Our improvements transfer to a Boston Dynamics Spot robot initialized with a set of skills (specified in language) and associated preconditions, where CAPE improves the correctness metric of the executed task plans by 76.49% compared to SayCan. Our approach enables the robot to follow natural language commands and robustly recover from failures, which baseline approaches largely cannot resolve or address inefficiently.
研究动机与目标
- 解决基于 LLM 的规划中缺乏故障恢复的问题,因为代理在失败后通常会重复尝试而未解决根本原因。
- 使具身代理能够利用 LLMs 在任务执行期间自主纠正前提条件违规。
- 通过聚焦于特定前提条件错误的纠正推理,减少对全面技能搜索的依赖。
- 在模拟和真实世界机器人环境中提升计划的可执行性和语义正确性。
- 与 SayCan 等基线方法相比,尤其在大规模技能库设置下,最小化重新提示和计算开销。
提出的方法
- 提出一种称为 CAPE 的重新提示策略,当动作执行失败时,通过模板化提示将前提条件错误信息注入 LLMs。
- 利用少样本上下文学习,结合语义相似的示范任务,引导 LLM 生成纠正措施。
- 采用两阶段流程:首先,规划 LLM 生成自由形式的动作序列;其次,翻译 LLM 将这些动作映射到代理技能库中的可执行动作。
- 将失败动作的反馈——特别是被违反的前提条件——注入提示中,以引导 LLM 生成纠正措施。
- 通过根据可用领域知识和反馈粒度调整重新提示方法,支持小规模和大规模技能库。
- 通过避免完整技能空间迭代来优化效率,将时间复杂度从 SayCan 的 O(|s|^n) 降低至 O(n)。
实验结果
研究问题
- RQ1当在规划期间提供前提条件错误反馈时,LLMs 是否能生成语义上正确的纠正措施?
- RQ2与基线 LLM 规划方法相比,注入前提条件错误信息在多大程度上提升了计划的可执行性和正确性?
- RQ3在大规模技能库设置下,CAPE 在多大程度上减少了重新提示和计算开销?
- RQ4CAPE 是否能在无需大量领域特定调优的情况下,泛化到模拟环境和真实世界机器人系统?
- RQ5尽管未访问完整的功能模型,CAPE 是否仍能优于基于 oracle 的方法(如 SayCan)在正确性和效率方面?
主要发现
- 与 SayCan 相比,CAPE 将 VirtualHome 模拟环境中的人工标注计划正确率从 28.89% 提升至 49.63%。
- 在 Boston Dynamics Spot 机器人上,CAPE 在计划正确率上相比 SayCan 实现了 76.49% 的绝对提升,即使 SayCan 处于 oracle 设置下。
- 当使用显式原因和少样本提示时,CAPE 在机器人演示中实现了 100% 的可执行性,优于所有基线方法。
- 该方法将时间复杂度从 SayCan 的 O(|s|^n) 降低至 O(n),显著提升了大规模技能库环境下的可扩展性。
- 即使 LLM 无法访问视觉反馈或完整功能模型,CAPE 仍能生成更少前提条件错误的语义正确计划。
- 正确性评估的评分者间一致性为中等(Fleiss’ Kappa),但重新采样基线的评分者一致拒绝计划为不可执行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。