[论文解读] Contrastive Instruction-Trajectory Learning for Vision-Language Navigation
本文提出对比指令-轨迹学习(CITL),一种新颖的框架,通过利用粗粒度和细粒度对比学习,提升指令-轨迹对之间的表征学习能力,从而增强视觉语言导航性能。通过引入成对样本重加权机制以挖掘困难负样本并缓解数据偏差,CITL在R2R、R4R和RxR基准上实现最先进性能,其泛化能力和鲁棒性优于先前方法。
The vision-language navigation (VLN) task requires an agent to reach a target with the guidance of natural language instruction. Previous works learn to navigate step-by-step following an instruction. However, these works may fail to discriminate the similarities and discrepancies across instruction-trajectory pairs and ignore the temporal continuity of sub-instructions. These problems hinder agents from learning distinctive vision-and-language representations, harming the robustness and generalizability of the navigation policy. In this paper, we propose a Contrastive Instruction-Trajectory Learning (CITL) framework that explores invariance across similar data samples and variance across different ones to learn distinctive representations for robust navigation. Specifically, we propose: (1) a coarse-grained contrastive learning objective to enhance vision-and-language representations by contrasting semantics of full trajectory observations and instructions, respectively; (2) a fine-grained contrastive learning objective to perceive instructions by leveraging the temporal information of the sub-instructions; (3) a pairwise sample-reweighting mechanism for contrastive learning to mine hard samples and hence mitigate the influence of data sampling bias in contrastive learning. Our CITL can be easily integrated with VLN backbones to form a new learning paradigm and achieve better generalizability in unseen environments. Extensive experiments show that the model with CITL surpasses the previous state-of-the-art methods on R2R, R4R, and RxR.
研究动机与目标
- 为解决现有视觉语言导航(VLN)方法在区分指令-轨迹对之间相似性与差异性方面的局限性。
- 通过显式建模子指令中的时间连续性,改进表征学习,而这一特性在先前方法中常被忽略。
- 通过新颖的成对样本重加权机制,减轻对比学习中易样本的数据采样偏差与梯度主导问题。
- 通过学习不变且具有判别性的视觉与语言表征,提升在未见环境中的导航策略泛化性与鲁棒性。
提出的方法
- 提出一种粗粒度对比学习目标,用于对比正样本、内部负样本和跨实例负样本的完整轨迹与指令嵌入。
- 通过对指令和轨迹进行数据增强以生成正样本,而次优和异常轨迹则作为内部负样本。
- 提出一种细粒度对比学习目标,用于建模子指令之间的时间关系,将相邻子指令视为正样本,非相邻子指令视为负样本。
- 引入成对样本重加权机制,动态重加权困难正负样本,以降低噪声并提升训练稳定性。
- 采用多对对比损失并结合样本挖掘,聚焦于困难样本的学习,避免因易负样本导致性能饱和。
- 将CITL框架与现有VLN主干网络集成,形成即插即用的学习范式,在无需架构重构的前提下提升泛化能力。
实验结果
研究问题
- RQ1在完整指令-轨迹对上进行对比学习,是否能提升视觉语言导航策略的鲁棒性与泛化能力?
- RQ2与将指令视为整体单元相比,建模子指令的时间连续性如何提升导航性能?
- RQ3困难样本挖掘与重加权在多大程度上可缓解数据偏差并改善对比VLN训练中的收敛性?
- RQ4结合粗粒度与细粒度对比目标是否能实现表征学习与导航成功率的协同提升?
- RQ5所提出的框架是否能在无需架构修改的情况下有效泛化至未见环境?
主要发现
- 完整CITL框架在R2R验证-未见分割上达到55.83% SPL,较基线提升2.93个百分点。
- 仅使用粗粒度对比损失,SPL从52.90%提升至55.47%,证明跨实例对比学习的价值。
- 仅使用细粒度对比损失,SPL从52.90%提升至55.17%,表明其具有显著贡献。
- 成对样本重加权机制使SPL从52.62%提升至55.47%,证实其在缓解数据偏差与噪声方面的有效性。
- 消融实验表明,三者(粗粒度、细粒度与重加权)结合时泛化性能最佳,在R2R上实现62.11%成功率与12.36%训练损失。
- 模型在各基准上泛化良好,在R2R、R4R和RxR上均取得最先进结果,表明其具备强大鲁棒性与可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。