Skip to main content
QUICK REVIEW

[论文解读] Tactical Rewind: Self-Correction via Backtracking in Vision-and-Language Navigation

Liyiming Ke, Xiujun Li|arXiv (Cornell University)|Mar 6, 2019
Multimodal Machine Learning Applications参考文献 24被引用 11
一句话总结

本文提出了 Fast Navigator,一种自校正的视觉-语言导航框架,通过在局部动作决策与全局进展信号之间取得平衡,实现在智能体检测到偏离路径时高效回溯。通过将局部与全局信号融合至异步搜索机制中,Fast 在 R2R 基准测试中实现了成功率为路径长度加权(SPL)的 6% 绝对提升,创下新 SOTA 成绩。

ABSTRACT

We present the Frontier Aware Search with backTracking (FAST) Navigator, a general framework for action decoding, that achieves state-of-the-art results on the Room-to-Room (R2R) Vision-and-Language navigation challenge of Anderson et. al. (2018). Given a natural language instruction and photo-realistic image views of a previously unseen environment, the agent was tasked with navigating from source to target location as quickly as possible. While all current approaches make local action decisions or score entire trajectories using beam search, ours balances local and global signals when exploring an unobserved environment. Importantly, this lets us act greedily but use global signals to backtrack when necessary. Applying FAST framework to existing state-of-the-art models achieved a 17% relative gain, an absolute 6% gain on Success rate weighted by Path Length (SPL).

研究动机与目标

  • 为解决现有视觉-语言导航智能体在依赖贪婪解码或昂贵束搜索时存在的暴露偏差与效率低下问题。
  • 开发一种导航框架,使智能体能够通过结合局部与全局信号实现回溯,检测并纠正错误。
  • 在推理阶段不增加计算成本的前提下,提升在未见环境中的导航效率与成功率。
  • 构建一种即插即用的框架,兼容现有 SOTA 模型,以提升其在 R2R 基准测试中的表现。

提出的方法

  • Fast Navigator 采用异步搜索策略,维护一个候选轨迹的前沿集合,结合局部动作决策与全局进展估计。
  • 使用融合函数将多种信号——局部动作似然、进展监控器与视觉-语言对齐分数——整合为单一全局得分,用于轨迹排序。
  • 该框架动态评估是否应继续前进或回溯,基于对目标进展的估计,实现在无需完整重规划的情况下实现自校正。
  • 采用多层感知机(MLP)学习不同进展信号的最优加权,提升轨迹重排序与决策能力。
  • 该方法设计为模块化与可扩展,可无缝集成至任意现有 VLN 智能体,无需架构重构即可提升性能。
  • 智能体采用全景动作空间(36 个视角)与停止动作,支持在照片级真实感环境中实现细粒度导航。

实验结果

研究问题

  • RQ1导航智能体能否在局部动作选择与全局进展监控之间取得平衡,以减少暴露偏差并避免陷入循环?
  • RQ2基于全局进展信号的回溯能否同时提升视觉-语言导航的成功率与路径效率?
  • RQ3轻量级异步搜索框架在 SPL 表现上能否超越束搜索,同时保持低计算成本?
  • RQ4来自多源信号(如动作似然、进展监控器、对齐分数)的融合在引导导航决策方面有多有效?

主要发现

  • Fast Navigator 在 R2R 基准测试中实现了成功率为路径长度加权(SPL)的 6% 绝对提升,相较于先前 SOTA 模型实现 17% 的相对增长。
  • 该框架在未见环境上表现出更强泛化能力,在验证集未见划分(val-unseen)上达到 71.00% SPL,显著优于贪婪基线与束搜索方法。
  • 融合多种全局信号(如进展监控器、视觉-语言对齐与动作似然)可获得最高性能,在训练集上实现 90.16% 的成功率。
  • 消融实验证明,通过学习的融合模型(MLP)组合所有信号可取得最佳结果,优于单一组件,表明信号整合的重要性。
  • 该模型展现出稳健的自校正能力:在真实示例中,成功摆脱了使贪婪智能体陷入行为循环的困境,证明了回溯的有效性。
  • 该框架具有高度可扩展性,可应用于现有模型,性能提升与底层模型或特征的改进程度成正比。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。