[论文解读] March in Chat: Interactive Prompting for Remote Embodied Referring Expression
本文提出 March-in-Chat(MiC),一种新颖的交互式提示框架,使视觉-语言导航智能体能够在 REVERIE 基准中通过与大型语言模型(LLM)进行实时对话,动态规划导航路径。通过整合一种房间与物体感知场景观察器(ROASP)以实现环境感知,并结合两种规划模块——目标导向静态规划(GOSP)与场景导向动态规划(SODP),MiC 在 REVERIE 测试集上实现了最先进性能,SPL 达到 41.97%,RGSPL 达到 26.17%,显著优于先前方法。
Many Vision-and-Language Navigation (VLN) tasks have been proposed in recent years, from room-based to object-based and indoor to outdoor. The REVERIE (Remote Embodied Referring Expression) is interesting since it only provides high-level instructions to the agent, which are closer to human commands in practice. Nevertheless, this poses more challenges than other VLN tasks since it requires agents to infer a navigation plan only based on a short instruction. Large Language Models (LLMs) show great potential in robot action planning by providing proper prompts. Still, this strategy has not been explored under the REVERIE settings. There are several new challenges. For example, the LLM should be environment-aware so that the navigation plan can be adjusted based on the current visual observation. Moreover, the LLM planned actions should be adaptable to the much larger and more complex REVERIE environment. This paper proposes a March-in-Chat (MiC) model that can talk to the LLM on the fly and plan dynamically based on a newly proposed Room-and-Object Aware Scene Perceiver (ROASP). Our MiC model outperforms the previous state-of-the-art by large margins by SPL and RGSPL metrics on the REVERIE benchmark.
研究动机与目标
- 为解决仅使用高层次、粗粒度自然语言指令在复杂、大规模 3D 环境中导航的挑战,如 REVERIE 基准所设定的场景。
- 通过促进智能体与 LLM 之间实时对话,使 LLM 成为动态、环境感知的规划者。
- 通过整合实时场景感知与自适应规划,提升远程具身指代表达任务中的导航与目标定位性能。
- 弥合具有详细指令的模拟 VLN 任务与现实世界应用之间的差距,后者用户仅发出高层次指令。
提出的方法
- MiC 框架采用一种房间与物体感知场景观察器(ROASP)模块,分析当前视觉观测并生成用于提示的环境感知描述。
- 目标导向静态规划(GOSP)模块查询 LLM,利用 LLM 内部的世界知识识别目标物体并推断其可能位置。
- 场景导向动态规划(SODP)模块通过在智能体进入新房间时实时整合 ROASP 的反馈,动态生成逐步导航指令。
- 系统采用交互式提示机制,反复向 LLM 提供更新后的上下文,包括原始指令、先前动作和当前场景描述,以生成自适应导航计划。
- LLM 通过结构化指令模板进行提示,该模板结合了高层级 REVERIE 指令、示范示例以及 ROASP 生成的场景描述,以引导细粒度规划。
- 智能体根据 LLM 生成的计划执行动作,并在检测到房间切换时重新与 LLM 交互,实现对环境变化的持续适应。
实验结果
研究问题
- RQ1在仅提供高层次指令的 REVERIE 基准中,与大型语言模型(LLM)进行交互式提示是否能提升导航规划性能?
- RQ2通过房间与物体感知场景观察器(ROASP)实现的环境感知,如何提升 LLM 生成导航计划的质量与适应性?
- RQ3相较于静态或固定提示策略,在长时程、大规模导航任务中,动态、场景感知提示的贡献是什么?
- RQ4与基线或静态提示方法相比,与 LLM 进行实时对话在多大程度上提升了导航成功率与定位准确性?
主要发现
- MiC 在 REVERIE 测试集未见样本上实现了新的最先进性能,SPL 达到 41.97%,RGSPL 达到 26.17%,分别比之前最先进方法高出至少 3.09% 和 3.49%。
- 消融实验证明,结合 ROASP 的动态规划模块相比静态提示策略显著提升性能,SPL 提升 1.2 个百分点,RGSPL 提升 0.8 个百分点。
- 人工评估确认,SODP 模块生成的导航指令更具相关性与合理性,相关性评分为 2.06,合理性评分为 1.93(满分 3 分)。
- 移除动态示范使相关性与合理性评分分别下降 31.55% 和 36.27%,表明上下文感知、动态演化的提示至关重要。
- ROASP 模块对性能有显著贡献,移除后相关性与合理性评分分别降至 1.64 和 1.55,证明其在场景理解中的价值。
- 定性分析表明,系统生成的导航计划具有一致性、上下文相关性,并能随房间切换自适应调整,保持全程逻辑连贯。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。