[论文解读] Open-vocabulary Queryable Scene Representations for Real World Planning
该论文提出 NLMap,一种基于 CLIP 和 ViLD 视觉-语言模型的开放词汇、可查询场景表征方法,用于将基于大语言模型(LLM)的规划器锚定于真实世界环境。通过支持自然语言查询物体存在与位置,NLMap 提升了长时程机器人规划性能,在 55 项真实世界任务中实现了 61.8% 的成功率——其中 35 项任务因先前最先进规划器缺乏开放词汇场景锚定而无法完成。
Large language models (LLMs) have unlocked new capabilities of task planning from human instructions. However, prior attempts to apply LLMs to real-world robotic tasks are limited by the lack of grounding in the surrounding scene. In this paper, we develop NLMap, an open-vocabulary and queryable scene representation to address this problem. NLMap serves as a framework to gather and integrate contextual information into LLM planners, allowing them to see and query available objects in the scene before generating a context-conditioned plan. NLMap first establishes a natural language queryable scene representation with Visual Language models (VLMs). An LLM based object proposal module parses instructions and proposes involved objects to query the scene representation for object availability and location. An LLM planner then plans with such information about the scene. NLMap allows robots to operate without a fixed list of objects nor executable options, enabling real robot operation unachievable by previous methods. Project website: https://nlmap-saycan.github.io
研究动机与目标
- 在无需依赖固定物体列表的情况下,实现在动态、开放词汇环境中的真实世界机器人任务规划。
- 解决先前 LLM 规划器缺乏物理场景锚定、无法处理新物体或开放词汇物体查询的局限性。
- 开发一种灵活且持久的场景表征,支持对物体可及性与位置的自然语言查询。
- 将该表征与规划框架(SayCan)集成,以实现基于上下文感知的、可执行的自然语言指令规划。
- 在非结构化环境中对真实机器人进行基准测试,展示其性能超越先前最先进方法的能力。
提出的方法
- NLMap 使用与类别无关的边界框构建物体候选的特征点云,每个候选关联 512D 的 CLIP 和 ViLD 视觉嵌入。
- 通过计算查询文本与场景嵌入之间的文本-视觉特征对齐得分,实现自然语言查询,可视化为热力图。
- 采用多视角融合策略,整合多个摄像头视角的检测结果,以降低噪声并提高检测可靠性。
- 基于 LLM 的物体候选模块解析指令,识别需查询 NLMap 表征的相关物体。
- LLM 规划器利用查询结果(物体存在性与位置)生成上下文相关的、可执行的动作规划。
- 系统部署于 Everyday Robots 的真实机器人上,感知、物体候选与规划模块均使用零样本预训练模型。
实验结果
研究问题
- RQ1能否构建一种场景表征,支持在真实世界环境中对物体存在与位置进行开放词汇、自然语言查询?
- RQ2如何在不依赖预定义物体列表或硬编码物体位置的情况下,有效将基于 LLM 的规划器锚定于真实世界场景?
- RQ3将 CLIP 与 ViLD 嵌入结合并采用多视角融合,对真实世界环境中开放词汇物体检索的准确性有何影响?
- RQ4NLMap 在多大程度上能够实现先前最先进规划器因缺乏场景锚定而无法完成的新机器人任务?
- RQ5NLMap 与 SayCan 的集成在多大程度上提升了长时程、基于指令的机器人规划的成功率?
主要发现
- NLMap 在 Scene 1 中实现 82% 的感知成功率,在 Scene 2 中实现 64%,显著优于单独使用 CLIP 或 ViLD 嵌入。
- 最大集成与多视角融合的结合使 Scene 2 中的查询成功率提升 17%,证明了融合多重视觉特征与视角的有效性。
- LLM 规划器在正样本测试中实现 85% 的成功率,在负样本测试中实现 60% 的成功率,表明其在正确物体锚定下的上下文感知规划具有强大性能。
- 在 55 项真实世界任务中,有 35 项任务对先前最先进规划器而言不可行,凸显 NLMap 实现新任务类别的能力。
- 该系统在厨房环境中 55 项真实任务中实现 61.8% 的成功率,执行轨迹显示正确识别物体,例如通过 CLIP 特征理解标识牌。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。