[论文解读] Co-NavGPT: Multi-Robot Cooperative Visual Semantic Navigation Using Vision Language Models
Co-NavGPT 是一种新颖的多机器人视觉语义导航框架,利用大型语言模型(LLMs)作为全局规划器,根据环境提示为机器人分配探索前沿。通过将地图特征编码为自然语言提示,实现了零样本、无学习的协作导航,在 HM3D 上实现了 66.1% 的成功率和 1.831 的平均到达时间,优于所有基线方法。
Visual target navigation is a critical capability for autonomous robots operating in unknown environments, particularly in human-robot interaction scenarios. While classical and learning-based methods have shown promise, most existing approaches lack common-sense reasoning and are typically designed for single-robot settings, leading to reduced efficiency and robustness in complex environments. To address these limitations, we introduce Co-NavGPT, a novel framework that integrates a Vision Language Model (VLM) as a global planner to enable common-sense multi-robot visual target navigation. Co-NavGPT aggregates sub-maps from multiple robots with diverse viewpoints into a unified global map, encoding robot states and frontier regions. The VLM uses this information to assign frontiers across the robots, facilitating coordinated and efficient exploration. Experiments on the Habitat-Matterport 3D (HM3D) demonstrate that Co-NavGPT outperforms existing baselines in terms of success rate and navigation efficiency, without requiring task-specific training. Ablation studies further confirm the importance of semantic priors from the VLM. We also validate the framework in real-world scenarios using quadrupedal robots. Supplementary video and code are available at: https://sites.google.com/view/co-navgpt2.
研究动机与目标
- 解决复杂环境中单机器人视觉目标导航效率低下和鲁棒性差的问题。
- 通过用基于 LLM 的推理替代端到端训练,降低多机器人协作策略的计算成本。
- 通过基于提示的场景理解,利用 LLM 作为全局规划器,实现在未知环境中的高效协作探索。
- 评估 LLM 在无需微调的零样本多机器人协作导航中的可行性与性能。
提出的方法
- 该框架将语义地图和机器人状态编码为自然语言提示,以增强 LLM 的场景理解能力。
- LLM 作为全局规划器,根据上下文线索、目标物体和空间布局,为每台机器人分配未探索的前沿。
- 前沿选择由包含物体语义、结构布局、机器人位置和目标描述的提示引导。
- 每台机器人在接收 LLM 分配的前沿后,使用统一的局部规划算法执行动作。
- 通过语义分割提取环境特征,并将其整合到 LLM 的输入提示中。
- 该系统以零样本方式运行,无需微调或强化学习。
实验结果
研究问题
- RQ1LLM 是否可以在无需任何学习过程的情况下,作为多机器人协作视觉导航的有效全局规划器?
- RQ2对环境特征进行基于提示的编码,如何提升 LLM 在探索和目标搜索推理方面的能力?
- RQ3与传统启发式或学习型策略相比,使用 LLM 进行前沿分配的性能提升如何?
- RQ4语义分割的准确性如何影响 Co-NavGPT 框架中的整体导航成功率?
主要发现
- Co-NavGPT 在 HM3D 基准测试中实现了 66.1% 的成功率,显著优于所有基线方法,包括 Greedy(61.1%)、Cost-Utility(62.5%)和 Random Sampling(63.6%)。
- 该框架将平均到达时间(DTG)降低至 1.831,为所有方法中最低,表明导航效率更优。
- 单机器人变体 Single-NavGPT 的成功率仅为 53.9%,证明了多机器人协作带来的性能增益。
- 使用真实分割结果(Co-NavGPT GT-Seg)可将成功率提升至 75.7%,凸显了准确语义映射的关键作用。
- 消融实验表明,语义分割是关键瓶颈,当用预测分割替代真实分割时,性能显著下降。
- 该模型展现出强大的泛化能力,在无需任何微调或强化学习的情况下实现高性能,证明了 LLM 在零样本多机器人规划中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。