Skip to main content
QUICK REVIEW

[论文解读] SASRA: Semantically-aware Spatio-temporal Reasoning Agent for Vision-and-Language Navigation in Continuous Environments

Muhammad Zubair Irshad, Niluthpol Chowdhury Mithun|arXiv (Cornell University)|Aug 26, 2021
Multimodal Machine Learning Applications参考文献 45被引用 4
一句话总结

本文提出SASRA,一种用于连续3D环境中视觉-语言导航的语义感知时空推理智能体,结合基于Transformer的跨模态注意力机制与混合循环模型,构建自上而下的语义地图并将其与语言指令对齐。该方法通过结构化语义映射和注意力驱动的跨模态推理,增强了空间感知与时间记忆,在未见过的环境中实现了比最先进基线方法高出22%的SPL相对提升。

ABSTRACT

This paper presents a novel approach for the Vision-and-Language Navigation (VLN) task in continuous 3D environments, which requires an autonomous agent to follow natural language instructions in unseen environments. Existing end-to-end learning-based VLN methods struggle at this task as they focus mostly on utilizing raw visual observations and lack the semantic spatio-temporal reasoning capabilities which is crucial in generalizing to new environments. In this regard, we present a hybrid transformer-recurrence model which focuses on combining classical semantic mapping techniques with a learning-based method. Our method creates a temporal semantic memory by building a top-down local ego-centric semantic map and performs cross-modal grounding to align map and language modalities to enable effective learning of VLN policy. Empirical results in a photo-realistic long-horizon simulation environment show that the proposed approach outperforms a variety of state-of-the-art methods and baselines with over 22% relative improvement in SPL in prior unseen environments.

研究动机与目标

  • 为解决在连续3D环境中视觉-语言导航(VLN)中的泛化差距问题,现有端到端模型因语义与时间推理能力有限而失效。
  • 将经典语义映射与深度学习相结合,以增强导航智能体的空间与时间感知能力。
  • 通过构建持久的、语义基础的环境记忆,提升对未见环境的零样本泛化能力。
  • 通过基于DAGGER的模仿学习减少策略训练中的暴露偏差,提升推理阶段的鲁棒性。

提出的方法

  • 智能体在每个时间步,利用学习到的语义分割头,从RGB和深度观测中构建自上而下的、以智能体为中心的语义地图。
  • 提出一种新型2D跨模态语义-语言注意力地图变换器(SLAM-T),用于同时关注语义地图与自然语言指令,实现跨模态定位。
  • 混合循环模块将Transformer编码器用于全局上下文建模,同时结合LSTM进行序列状态追踪,以在时间步之间保持长期记忆。
  • 动作解码器采用混合架构(HAD),结合离散与连续动作头,以生成细粒度的导航决策。
  • 策略通过DAGGER(数据集聚合)进行训练,以减少暴露偏差,并在推理过程中提升鲁棒性。
  • 模型在VLN-CE数据集上进行端到端训练,结合模仿学习与基于课程的监督。

实验结果

研究问题

  • RQ1结合结构化语义记忆的混合Transformer-循环架构是否能提升在未见连续3D环境中的视觉-语言导航泛化能力?
  • RQ2语言指令与学习到的语义地图之间的跨模态注意力在引导长时程导航方面有多高效?
  • RQ3与仅使用原始视觉输入相比,引入自上而下的语义地图在多大程度上提升了空间推理能力并减少了导航错误?
  • RQ4与教师强制法相比,基于DAGGER的训练是否显著降低了暴露偏差并提升了VLN-CE中的策略鲁棒性?
  • RQ5语义映射、SLAM-T、HAD与DAGGER等各组件对整体性能提升的贡献程度如何?

主要发现

  • SASRA在未见环境中的成功加权路径长度(SPL)相比最先进基线方法实现了22%的相对提升。
  • 引入SLAM-T模块使成功率达到绝对提升4%,SPL提升3%,证明了跨模态注意力的价值。
  • 与标准RNN解码器相比,混合动作解码器(HAD)在SR与SPL上均带来5%的绝对提升,凸显其在动作生成中的重要性。
  • 与教师强制法相比,DAGGER训练使SR与SPL均实现9%的绝对提升,证明其在降低暴露偏差方面的有效性。
  • 定性分析显示,该智能体在未见环境中成功导航复杂、长时程指令(例如62步),并在语义上下文支持下正确理解模糊短语如“走出去”(step outside)。
  • 消融实验确认,语义映射、SLAM-T、HAD与DAGGER的组合对最优性能至关重要,各组件对最终结果均有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。