[论文解读] Plan, Eliminate, and Track -- Language Models are Good Teachers for Embodied Agents
该论文提出了计划-消除-追踪(Plan, Eliminate, and Track, PET)框架,利用预训练的大语言模型(LLMs)作为提供知识的教师,指导具身智能体在文本环境中的行为。通过将任务分解为子任务、过滤无关的环境元素并追踪进展,PET在不微调智能体或LLMs的前提下,使具身智能体在AlfWorld基准上对人类指定目标的零样本泛化能力相比当前最先进方法提升了15%。
Pre-trained large language models (LLMs) capture procedural knowledge about the world. Recent work has leveraged LLM's ability to generate abstract plans to simplify challenging control tasks, either by action scoring, or action modeling (fine-tuning). However, the transformer architecture inherits several constraints that make it difficult for the LLM to directly serve as the agent: e.g. limited input lengths, fine-tuning inefficiency, bias from pre-training, and incompatibility with non-text environments. To maintain compatibility with a low-level trainable actor, we propose to instead use the knowledge in LLMs to simplify the control problem, rather than solving it. We propose the Plan, Eliminate, and Track (PET) framework. The Plan module translates a task description into a list of high-level sub-tasks. The Eliminate module masks out irrelevant objects and receptacles from the observation for the current sub-task. Finally, the Track module determines whether the agent has accomplished each sub-task. On the AlfWorld instruction following benchmark, the PET framework leads to a significant 15% improvement over SOTA for generalization to human goal specifications.
研究动机与目标
- 提升具身智能体在文本环境中对未见过的人类目标规范的泛化能力。
- 解决直接将LLMs用作智能体的局限性,例如输入长度限制、微调效率低下以及与非文本模态的不兼容性。
- 在保持与可训练低层级策略网络兼容的同时,利用LLMs的程序性知识和常识知识。
- 设计一种模块化、零样本的框架,通过不微调的方式增强规划、感知和进展追踪能力。
- 证明LLMs可通过高层抽象和推理简化控制任务,从而作为有效教师发挥作用。
提出的方法
- 计划模块使用上下文提示(in-context prompting)与预训练LLM,将自然语言任务分解为一系列高层子任务。
- 消除模块采用零样本问答模型,根据当前子任务从环境观测中屏蔽无关的物体和容器。
- 追踪模块使用另一个零样本问答模型,判断当前子任务是否已完成,从而实现计划的动态推进。
- 一个基于Transformer架构的行动注意力智能体处理经过屏蔽的观测,并根据当前子任务采取动作,能够处理可变长度的动作空间。
- 整个框架在不微调LLMs或智能体的前提下运行,所有组件均依赖上下文提示和零样本问答。
- 多个LLM协同工作:一个用于规划,另外两个分别用于消除和追踪,各司其职,角色专业化。

实验结果
研究问题
- RQ1预训练LLMs能否提升具身智能体在文本环境中对人类指定目标的零样本泛化能力?
- RQ2LLMs如何在不直接参与动作执行的情况下简化控制任务?
- RQ3零样本问答模型在子任务上下文下,能在多大程度上过滤无关的环境元素?
- RQ4子任务规划与进展追踪是否能显著提升智能体处理复杂多步任务(如计数类任务)的能力?
- RQ5结合规划、消除与追踪的模块化框架是否能超越端到端LLM基智能体的性能?
主要发现
- PET框架在AlfWorld基准上对人类目标规范的泛化能力相比当前最先进方法提升了15%的成功率。
- 计划模块在精确率与召回率上均达到99%的准确度,表明其生成的子任务与专家计划高度一致。
- 消除模块通过常识推理成功从观测中移除40%的任务无关物体,提升了感知效率。
- 子任务规划与追踪显著提升了需要程序性计数的任务(如将两块香皂放入柜子)的性能。
- 消融实验表明,结合计划与追踪模块能增强消除模块的性能,体现出协同增益效应。
- 由于子任务嵌入与基于问答的追踪具有鲁棒性,该框架在面对未见过的人类目标时泛化能力出色,即使目标规范存在模糊性或轻微错误也能有效应对。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。