[论文解读] Transferable Representation Learning in Vision-and-Language Navigation
本论文提出了一种用于视觉-语言导航(VLN)的可迁移表征学习框架,通过在两个辅助任务——跨模态对齐(CMA)和下一视觉场景(NVS)——上对视觉和语言编码器进行自监督负样本挖掘的预训练,实现视觉与语言表征的域自适应。该方法显著提升了导航性能,其中RCM智能体在SPL指标上相比之前最先进模型实现了5%的绝对提升。
Vision-and-Language Navigation (VLN) tasks such as Room-to-Room (R2R) require machine agents to interpret natural language instructions and learn to act in visually realistic environments to achieve navigation goals. The overall task requires competence in several perception problems: successful agents combine spatio-temporal, vision and language understanding to produce appropriate action sequences. Our approach adapts pre-trained vision and language representations to relevant in-domain tasks making them more effective for VLN. Specifically, the representations are adapted to solve both a cross-modal sequence alignment and sequence coherence task. In the sequence alignment task, the model determines whether an instruction corresponds to a sequence of visual frames. In the sequence coherence task, the model determines whether the perceptual sequences are predictive sequentially in the instruction-conditioned latent space. By transferring the domain-adapted representations, we improve competitive agents in R2R as measured by the success rate weighted by path length (SPL) metric.
研究动机与目标
- 为解决预训练视觉与语言模型与下游VLN任务在真实3D环境中的域偏移问题。
- 通过构建高质量、自监督的辅助任务,减少对昂贵人工标注的指令-路径配对数据的依赖。
- 通过将预训练表征适应到领域内VLN分布,提升导航智能体的泛化能力与成功概率。
- 为Speaker-Follower与强化跨模态(RCM)等智能体提供更好的初始化,从而提升其在已见与未见环境中的性能。
提出的方法
- 在两个辅助任务——跨模态对齐(CMA)与下一视觉场景(NVS)预测——上联合预训练视觉与语言编码器。
- 使用对比学习与负样本挖掘训练NVS任务,预测在指令条件下的潜在空间中的未来视觉特征。
- 通过基于交叉注意力的相似度分数,训练CMA任务以判断给定指令是否与视觉帧序列匹配。
- 将两个任务的损失通过加权和结合:αℒ_alignment + (1−α)ℒ_coherence,以实现联合表征学习的优化。
- 将微调后的视觉与语言编码器作为特征提取器,迁移至下游导航智能体(如RCM与Speaker-Follower)。
- 通过模仿学习与多奖励强化学习,应用适配后的表征以提升智能体策略学习性能。
实验结果
研究问题
- RQ1自监督辅助任务能否提升预训练视觉与语言表征在视觉-语言导航任务中的可迁移性?
- RQ2在CMA与NVS上进行联合预训练,相较于仅在单一任务上预训练,其在下游导航任务中的性能表现如何?
- RQ3域自适应表征在VLN任务中未见环境上的泛化能力提升程度如何?
- RQ4所学习的表征能否增强现有最先进智能体(如RCM与Speaker-Follower)的性能?
- RQ5在辅助任务中使用负样本挖掘,是否能在无需人工标注的情况下实现有效的数据增强?
主要发现
- 使用在CMA与NVS上联合预训练的表征初始化的RCM智能体,在SPL指标上相比之前最先进模型实现了5%的绝对提升。
- 在CMA与NVS上进行联合预训练,使在已见与未见R2R验证集上的成功率(SR)提升了11–12%,相较于随机初始化或单任务初始化。
- 仅预训练NVS任务时性能下降,表明跨模态对齐对有效导航表征学习至关重要。
- 通过域自适应表征对视觉与语言编码器进行热启动,在未见数据集上实现了最高的SPL(提升7%以上),证明了其互补优势。
- 消融实验确认CMA与NVS学习到的表征具有互补性:CMA增强跨模态对齐能力,而NVS提升视觉序列建模能力。
- 基于CMA与NVS训练的评分模型还可实现长指令-路径序列的自动分割,表明其在课程学习方面具有潜在应用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。