[论文解读] HOP: History-and-Order Aware Pre-training for Vision-and-Language Navigation
本文提出 HOP,一种面向视觉-语言导航(VLN)的时序与历史感知预训练框架,通过整合动作预测、历史建模、轨迹顺序建模(TOM)、群体顺序建模(GOM)以及标准代理任务,增强时空视觉-语言理解。该方法在四个 VLN 基准上均取得最先进性能,包括在 R2R 上达到 63.86% 的 SPL 和在 NDH 上达到 4.37% 的成功率,证明了在预训练中建模历史上下文与时间顺序的有效性。
Pre-training has been adopted in a few of recent works for Vision-and-Language Navigation (VLN). However, previous pre-training methods for VLN either lack the ability to predict future actions or ignore the trajectory contexts, which are essential for a greedy navigation process. In this work, to promote the learning of spatio-temporal visual-textual correspondence as well as the agent's capability of decision making, we propose a novel history-and-order aware pre-training paradigm (HOP) with VLN-specific objectives that exploit the past observations and support future action prediction. Specifically, in addition to the commonly used Masked Language Modeling (MLM) and Trajectory-Instruction Matching (TIM), we design two proxy tasks to model temporal order information: Trajectory Order Modeling (TOM) and Group Order Modeling (GOM). Moreover, our navigation action prediction is also enhanced by introducing the task of Action Prediction with History (APH), which takes into account the history visual perceptions. Extensive experimental results on four downstream VLN tasks (R2R, REVERIE, NDH, RxR) demonstrate the effectiveness of our proposed method compared against several state-of-the-art agents.
研究动机与目标
- 解决先前 VLN 预训练方法忽略指令中历史视觉上下文与时间顺序的局限性。
- 通过在预训练过程中将过往观测结果纳入决策过程,提升动作预测的准确性。
- 通过新颖的代理任务,显式建模视觉轨迹与指令中的时间顺序。
- 提升在多样化 VLN 任务中的泛化能力,包括域内(R2R)与域外(RxR、NDH、REVERIE)设置。
- 证明结合历史感知与顺序感知预训练目标可带来优于单一组件的下游性能提升。
提出的方法
- 提出动作预测与历史(APH),即模型利用当前与过去视觉观测预测下一步导航动作。
- 提出轨迹顺序建模(TOM),要求模型重建被打乱的视觉轨迹帧的正确顺序。
- 引入群体顺序建模(GOM),即模型需预测从指令中提取的两个子轨迹的正确顺序。
- 将这些新颖任务与标准预训练目标(掩码语言建模(MLM)和轨迹-指令匹配(TIM))结合。
- 在多样化数据集(包括 PREVALENT 和 BnB*-处理数据)上进行预训练,以提升泛化能力。
- 在四个下游 VLN 任务(R2R、RxR、NDH 和 REVERIE)上微调预训练模型。
实验结果
研究问题
- RQ1在预训练期间将历史视觉观测纳入动作预测是否能提升导航性能?
- RQ2建模细粒度轨迹顺序(TOM)与粗粒度群体顺序(GOM)是否能增强 VLN 中的时间推理能力?
- RQ3所提出的代理任务(APH、TOM、GOM)在有效性上与标准预训练目标(如 MLM 和 TIM)相比如何?
- RQ4在包括 BnB* 在内的多样化数据上进行预训练,对域外 VLN 任务(如 REVERIE)的性能提升程度如何?
- RQ5历史感知与顺序感知预训练目标的组合是否具有协同效应,带来超越单一组件的性能增益?
主要发现
- HOP 预训练框架在 R2R 基准上达到 63.86% 的 SPL,相较于无预训练基线提升了 9% 的成功率。
- 在 RxR 任务中,该方法实现 0.33 的 sDTW,展现出在长而复杂指令上的强大性能。
- 在 NDH 任务中,模型平均路径长度为 3.84 米,当使用额外的 BnB* 数据进行预训练时,相比基线提升了 1 米。
- 在 REVERIE 任务中,模型实现 24.34% 的 SPL 和 14.34% 的 RGSPL,当在 BnB*-处理数据上预训练时,成功率显著提升 6%。
- 消融实验表明,APH 对性能提升贡献最大,其次为 TOM、GOM 和 TIM,所有任务均表现出互补性改进。
- 消融实验显示,结合所有预训练任务(MLM、TIM、TOM、GOM、APH)可获得最高性能,在 NDH 上达到 4.37% 的成功率,优于仅使用单一任务的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。