[论文解读] BEVBert: Multimodal Map Pre-training for Language-guided Navigation
本文提出 BEVBert,一种用于视觉-语言导航的新型基于地图的预训练框架,通过结合局部度量地图与全局拓扑地图,增强跨模态的空间感知推理能力。通过利用离线的混合地图和地图预测代理任务,BEVBert 在四个 VLN 基准测试中达到最先进性能,包括在 R2R 测试未见数据集上实现 73% 的成功率。
Large-scale pre-training has shown promising results on the vision-and-language navigation (VLN) task. However, most existing pre-training methods employ discrete panoramas to learn visual-textual associations. This requires the model to implicitly correlate incomplete, duplicate observations within the panoramas, which may impair an agent's spatial understanding. Thus, we propose a new map-based pre-training paradigm that is spatial-aware for use in VLN. Concretely, we build a local metric map to explicitly aggregate incomplete observations and remove duplicates, while modeling navigation dependency in a global topological map. This hybrid design can balance the demand of VLN for both short-term reasoning and long-term planning. Then, based on the hybrid map, we devise a pre-training framework to learn a multimodal map representation, which enhances spatial-aware cross-modal reasoning thereby facilitating the language-guided navigation goal. Extensive experiments demonstrate the effectiveness of the map-based pre-training route for VLN, and the proposed method achieves state-of-the-art on four VLN benchmarks.
研究动机与目标
- 解决现有 VLN 预训练方法依赖离散全景图所带来的问题,即不完整和重复的视觉观测导致的混淆。
- 通过引入结合局部度量地图与全局拓扑地图的混合地图表示,提升语言引导导航中的空间推理能力。
- 通过一种新型基于地图的预训练范式,增强语言指令与视觉场景之间的跨模态对齐。
- 通过学习预测未观测区域的代理任务,减少导航决策中的不确定性。
提出的方法
- 从大规模 VLN 视觉路径中构建离线混合地图,结合局部度量地图用于细粒度空间推理,以及全局拓扑地图用于长期规划。
- 采用跨模态 Transformer 执行地图-指令交互,学习多模态地图表征。
- 引入地图预测代理任务,编码语言和空间先验知识以预测未观测区域,降低决策不确定性。
- 使用在线构建的混合地图进行序列动作预测微调,以提升导航策略性能。
- 采用受拓扑-度量 SLAM 启发的混合设计,但使用可学习的多模态表征以实现更好的泛化能力。
- 利用大规模数据预训练,提升在未见环境中的零样本泛化能力和鲁棒性。
实验结果
研究问题
- RQ1结合局部度量地图与全局拓扑地图的混合地图表示是否能提升视觉-语言导航中的空间推理能力?
- RQ2通过预测未观测区域的代理任务进行基于地图的预训练,是否能增强跨模态对齐并减少导航不确定性?
- RQ3所提出的 BEVBert 框架是否能在未见环境中实现泛化,并在多个 VLN 基准测试中超越现有预训练方法?
- RQ4与基于离散全景图的预训练相比,使用空间感知地图在导航成功率和鲁棒性方面表现如何?
- RQ5地图预测代理任务在多大程度上促进了 VLN 中长时程规划与短时程推理的提升?
主要发现
- BEVBert 在 R2R 测试未见数据集上实现 73% 的成功率,优于先前方法如 HAMT(60%)和 AirBert(59%)。
- 在 R2R-CE 基准测试中,BEVBert 在测试未见数据集上达到 59% 的成功率,显著超越此前最先进方法。
- 在 RxR 数据集上,BEVBert 实现 54.2% 的 SDTW,展现出在未见环境中强大的零样本泛化能力。
- 在 REVERIE 基准测试中,BEVBert 实现 52.81% 的 SR 和 36.41% 的 SPL,表现出色的指代表达理解与导航能力。
- 消融实验证实,地图预测代理任务显著提升了性能,尤其在长时程导航场景中表现突出。
- 定性分析显示,BEVBert 有效减少了在未见环境中因“过早丢失”和“歧义”导致的失败案例,尤其在 R2R 数据集上表现明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。