[论文解读] Embodied Vision-and-Language Navigation with Dynamic Convolutional Filters
本文提出了一种新颖的具身视觉-语言导航(VLN)框架,采用动态卷积滤波器生成低层次、代理友好的动作(例如,转向、向前移动),而非依赖高层级的瞬移(teleportation)。通过注意力驱动的滤波器关注相关的视觉和语言线索,该模型在R2R基准测试中取得了最先进性能,其成功率达到15%的提升,优于以往的低层次动作模型,并在SPL指标上与顶尖的高层级模型持平。
In Vision-and-Language Navigation (VLN), an embodied agent needs to reach a target destination with the only guidance of a natural language instruction. To explore the environment and progress towards the target location, the agent must perform a series of low-level actions, such as rotate, before stepping ahead. In this paper, we propose to exploit dynamic convolutional filters to encode the visual information and the lingual description in an efficient way. Differently from some previous works that abstract from the agent perspective and use high-level navigation spaces, we design a policy which decodes the information provided by dynamic convolution into a series of low-level, agent friendly actions. Results show that our model exploiting dynamic filters performs better than other architectures with traditional convolution, being the new state of the art for embodied VLN in the low-level action space. Additionally, we attempt to categorize recent work on VLN depending on their architectural choices and distinguish two main groups: we call them low-level actions and high-level actions models. To the best of our knowledge, we are the first to propose this analysis and categorization for VLN.
研究动机与目标
- 为解决具身VLN中高层级动作空间的局限性,其抽象了代理级别的控制并依赖于预先的地图知识。
- 开发一种基于实时视觉和语言输入生成原子化、低层次动作(例如,旋转、前进)的导航策略。
- 提出一种基于输出空间的VLN模型新分类体系——区分低层次动作(代理中心)与高层级动作(基于图的瞬移)。
- 通过利用根据语言指令自适应关注相关视觉特征的动态卷积滤波器,提升低层次VLN的性能。
- 通过保留代理在感知和作用于环境中的角色,实现更真实、主动且具身的导航。
提出的方法
- 通过与语言指令对齐的注意力机制生成动态卷积滤波器,实现从视觉观测中选择性提取特征。
- 滤波器具备空间自适应性和上下文感知性,聚焦于与当前导航目标相关的图像区域。
- 策略网络处理过滤后的特征,实时预测一系列低层次动作(例如,前进、左转、右转、停止)。
- 该架构在R2R数据集上通过模仿学习进行端到端训练,监督信号来自专家轨迹。
- 该模型不依赖于预计算的导航图或模拟器提供的视点连通性信息,因此在未见过的环境中更具鲁棒性。
- 提出一种新颖的评估协议,用于在相同输出空间(低层次 vs. 高层次)内比较模型,实现公平的基准测试。
实验结果
研究问题
- RQ1动态卷积滤波器如何改善低层次VLN中的视觉-语言特征对齐?
- RQ2基于动态滤波器的策略是否能在低层次动作空间VLN中超越标准卷积网络?
- RQ3在公平比较框架下,低层次与高层级动作空间模型之间的性能差异是什么?
- RQ4在成功率和SPL方面,所提方法与最先进高层级动作模型相比表现如何?
- RQ5低层次动作策略是否能在不依赖预计算导航图或瞬移的情况下实现具有竞争力的结果?
主要发现
- 所提模型在R2R测试集上的成功率达到15%的提升,优于以往的低层次动作模型,创下该类别新SOTA记录。
- 该模型在SPL指标上比高层级动作模型Speaker-Follower高出3%,表明即使仅使用低层次动作,也具备强大的泛化能力。
- 该模型在SPL指标上与最佳高层级动作模型(Ma et al., 2019a)相差不到1%,表明其具备极强的竞争力。
- 消融研究证实,与标准卷积相比,动态滤波器显著提升了特征选择与导航准确性。
- 所提出的低层次与高层级动作模型分类体系表明,同类模型内部性能差异较小,支持了更公平基准测试的必要性。
- 定性结果表明,代理能正确识别并关注与指令相关的视觉元素(例如,壁炉、门框),且在不同任务中保持一致的动作预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。