[论文解读] Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied Agents
本文提出 CAPEAM,一种用于具身智能体的新框架,通过整合上下文感知规划(CAP)以优先处理任务相关物体,以及环境感知记忆(EAM)以跨时间追踪物体状态和掩码,从而提升指令遵循性能。该方法在 ALFRED 基准测试中取得最先进结果,在未见过的环境中成功率最高提升 10.70%。
Accomplishing household tasks requires to plan step-by-step actions considering the consequences of previous actions. However, the state-of-the-art embodied agents often make mistakes in navigating the environment and interacting with proper objects due to imperfect learning by imitating experts or algorithmic planners without such knowledge. To improve both visual navigation and object interaction, we propose to consider the consequence of taken actions by CAPEAM (Context-Aware Planning and Environment-Aware Memory) that incorporates semantic context (e.g., appropriate objects to interact with) in a sequence of actions, and the changed spatial arrangement and states of interacted objects (e.g., location that the object has been moved to) in inferring the subsequent actions. We empirically show that the agent with the proposed CAPEAM achieves state-of-the-art performance in various metrics using a challenging interactive instruction following benchmark in both seen and unseen environments by large margins (up to +10.70% in unseen env.).
研究动机与目标
- 解决因对动作后果和环境状态变化建模不足而导致的具身智能体泛化能力差的问题。
- 通过在规划过程中引入语义上下文(如任务相关物体),改善长时程任务的规划能力。
- 通过保持物体位置和视觉掩码的持久记忆,克服因遮挡和动态物体状态变化导致的失败。
- 在不依赖人工设计的计划模板的前提下,实现在未见过环境中的鲁棒物体交互。
- 通过引入上下文与环境感知,减少不必要的探索和错误的物体交互,从而提升智能体效率。
提出的方法
- 提出上下文感知规划(CAP),首先从自然语言指令中预测任务相关物体(上下文),再生成一系列子目标。
- 在 CAP 中使用子目标规划器,生成包含上下文物体占位符的可执行动作序列,确保所有动作与任务核心物体保持一致。
- 实现环境感知记忆(EAM),即使物体被遮挡,也能存储包括空间位置和实例掩码在内的物体状态。
- 通过保留先前观测中物体的掩码,实现在 EAM 中的回溯物体识别,使智能体在当前感知失效时仍能与物体交互。
- 在 EAM 中集成物体重定位追踪机制,防止对已操作物体重复交互,从而减少因冗余动作导致的任务失败。
- 将 CAP 与 EAM 整合为端到端可训练的智能体架构,利用上下文规划与持久环境记忆的双重优势,提升决策能力。
实验结果
研究问题
- RQ1在规划阶段整合语义上下文(如任务相关物体)是否能显著提升具身智能体在长时程任务中的成功率?
- RQ2保持物体状态和视觉掩码的持久记忆在多大程度上能减少因遮挡和动态环境导致的失败?
- RQ3与现有基线方法相比,该方法在未见过环境中的泛化能力如何,尤其是在不依赖人工设计模板的情况下?
- RQ4环境感知记忆是否能防止对已操作物体的重复交互,从而提升任务效率?
- RQ5上下文感知规划与环境感知记忆的结合是否能在多样化的指令遵循基准测试中带来可量化的成功率与目标条件成功率提升?
主要发现
- CAPEAM 在 ALFRED 基准测试中达到最先进性能,在未见过环境中成功率最高较之前方法提升 10.70%。
- 配备 CAP 的智能体显著减少了错误的物体交互——例如,在需要手表和碗的任务中避免与刀等无关物体交互——通过聚焦于任务相关上下文。
- EAM 模块通过保留并重用先前存储的掩码,使智能体能够成功与被遮挡的物体(如被手表覆盖的碗)交互,从而防止因视觉遮挡导致的失败。
- EAM 中的物体重定位追踪机制可防止对已移动物体(如纸巾盒)的重复交互,减少基线智能体中常见的任务破坏性错误。
- CAPEAM 在已见与未见环境中均优于现有方法,展现出强大的零样本泛化能力,且不依赖人工设计的计划模板。
- 该方法在 CVPR 2023 举办的具身人工智能研讨会“通用语言接地智能体挑战赛”中夺得第一名,验证了其鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。