Skip to main content
QUICK REVIEW

[论文解读] Mind the Gap: Improving Success Rate of Vision-and-Language Navigation by Revisiting Oracle Success Routes

Chongyang Zhao, Yuankai Qi|arXiv (Cornell University)|Aug 7, 2023
Multimodal Machine Learning ApplicationsComputer Science被引用 3
一句话总结

本文通过提出一种轨迹定位方法,解决了视觉语言导航(Vision-and-Language Navigation, VLN)中长期被忽视的成功率(Success Rate, SR)与Oracle成功率(Oracle Success Rate, OSR)之间的差距。该方法能够从预生成的智能体轨迹中识别出正确的目标位置。通过使用多模块Transformer模型学习具有区分性的视角表征,该方法将R2R数据集上的SR与OSR差距从最高9%缩小至4.56%,显著提升了性能,且无需重新训练导航策略。

ABSTRACT

Vision-and-Language Navigation (VLN) aims to navigate to the target location by following a given instruction. Unlike existing methods focused on predicting a more accurate action at each step in navigation, in this paper, we make the first attempt to tackle a long-ignored problem in VLN: narrowing the gap between Success Rate (SR) and Oracle Success Rate (OSR). We observe a consistently large gap (up to 9%) on four state-of-the-art VLN methods across two benchmark datasets: R2R and REVERIE. The high OSR indicates the robot agent passes the target location, while the low SR suggests the agent actually fails to stop at the target location at last. Instead of predicting actions directly, we propose to mine the target location from a trajectory given by off-the-shelf VLN models. Specially, we design a multi-module transformer-based model for learning compact discriminative trajectory viewpoint representation, which is used to predict the confidence of being a target location as described in the instruction. The proposed method is evaluated on three widely-adopted datasets: R2R, REVERIE and NDH, and shows promising results, demonstrating the potential for more future research.

研究动机与目标

  • 为解决视觉语言导航(VLN)中长期被忽视的成功率(SR)与Oracle成功率(OSR)之间的性能差距,该差距在以往研究中未得到充分关注。
  • 探究为何最先进的VLN智能体在目标位置附近经过时,尽管Oracle成功率很高,却仍无法在正确位置停止。
  • 提出一种方法,通过检测由现成VLN模型生成的轨迹中的正确目标节点,来提升SR,而非重新训练导航策略。
  • 在多个基准测试上评估该方法的有效性,包括R2R、REVERIE和NDH,在域内和零样本设置下均进行测试。

提出的方法

  • 该方法将目标位置检测建模为视频定位任务,目标是根据自然语言指令在轨迹中定位目标帧(视角)。
  • 提出一种多模块Transformer架构,包括用于全景视图处理的仰角Transformer(E-Trans)、用于建模轨迹级依赖关系的时空Transformer(S-T Trans),以及用于预测目标置信度分数的目标选择Transformer(T-Trans)。
  • 通过在多个视角和时间步上关注相关的视觉和语言线索,模型学习到紧凑且具有区分性的轨迹视角表征。
  • 采用焦点损失(focal loss)与Dice损失的组合进行训练,以处理类别不平衡问题并提高定位精度,消融实验验证了损失设计的有效性。
  • 该方法作为后处理模块应用于现有VLN智能体生成的轨迹上,可在不修改原始策略的情况下纠正导航错误。
  • 额外使用来自900个HM3D环境的数据进行预训练,提升了零样本泛化能力以及在未见划分上的性能。

实验结果

研究问题

  • RQ1为何在最先进的VLN智能体中,尽管Oracle成功率很高,SR与OSR之间仍存在显著差距?
  • RQ2即使智能体未能在正确位置停止,是否仍能可靠地从预训练VLN智能体生成的轨迹中识别出目标位置?
  • RQ3基于多模块Transformer的方法在从一系列全景观测和自然语言指令中检测正确目标视角方面有多有效?
  • RQ4辅助训练数据和损失函数对目标定位模型性能有何影响?

主要发现

  • 在R2R验证集未见划分上,所提方法将SR-OSR差距从7.96%缩小至4.56%,实现了4.3个百分点的绝对提升。
  • 仰角Transformer(E-Trans)对性能贡献最大,其次为目标选择Transformer(T-Trans),时空Transformer(S-T Trans)的影响最小但仍有意义。
  • 与仅使用原始数据训练相比,使用HM3D环境的额外训练数据使SR提升了2.17%;仅在HM3D数据上训练的模型在R2R未见数据集上达到了45.52%的SR。
  • 焦点损失与Dice损失的组合表现最佳,优于BCE、焦点损失和BCE+Dice,表明联合优化多个预测可提升定位精度。
  • 消融实验表明,超参数调优对性能影响极小,说明该方法对损失权重变化具有鲁棒性。
  • 定性结果表明,该方法成功纠正了HOP、HAMT和DUET生成轨迹中的导航错误,使智能体能够准确停在目标位置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。