Skip to main content
QUICK REVIEW

[论文解读] Multi-View Learning for Vision-and-Language Navigation

Qiaolin Xia, Xiujun Li|arXiv (Cornell University)|Mar 2, 2020
Multimodal Machine Learning Applications参考文献 30被引用 11
一句话总结

本文提出 LEO(LEARN FROM EVERYONE),一种用于视觉-语言导航的多视角学习框架,通过联合训练同一轨迹的多个自然语言指令来提升泛化能力。通过在指令间共享参数并利用无参池化函数聚合信息,LEO 降低了语言歧义性并提升了性能,在 R2R 基准测试中达到 41.4% 的 SPL——比贪婪基线高出 16 个百分点;在使用多个指令时,SPL 达到 62%,展现出对未见环境的强大泛化能力。

ABSTRACT

Learning to navigate in a visual environment following natural language instructions is a challenging task because natural language instructions are highly variable, ambiguous, and under-specified. In this paper, we present a novel training paradigm, Learn from EveryOne (LEO), which leverages multiple instructions (as different views) for the same trajectory to resolve language ambiguity and improve generalization. By sharing parameters across instructions, our approach learns more effectively from limited training data and generalizes better in unseen environments. On the recent Room-to-Room (R2R) benchmark dataset, LEO achieves 16% improvement (absolute) over a greedy agent as the base agent (25.3% $ ightarrow$ 41.4%) in Success Rate weighted by Path Length (SPL). Further, LEO is complementary to most existing models for vision-and-language navigation, allowing for easy integration with the existing techniques, leading to LEO+, which creates the new state of the art, pushing the R2R benchmark to 62% (9% absolute improvement).

研究动机与目标

  • 解决视觉-语言导航中的语言歧义性和描述不充分问题。
  • 通过将多个指令作为同一轨迹的互补视角,提升对未见环境的泛化能力。
  • 开发一种训练范式,使智能体能够从多种指令变体的集体推理中学习,而非孤立地学习。
  • 证明多视角学习可显著提升视觉-语言导航任务的性能与鲁棒性。

提出的方法

  • LEO 将视觉-语言导航建模为多视角学习问题,将每条指令视为同一导航轨迹的独立视角。
  • 使用共享编码器处理给定轨迹的所有指令,实现参数共享与联合表征学习。
  • 通过无参池化函数(如平均池化)聚合指令表征,融合多视角的互补信息。
  • 将融合后的指令嵌入与视觉特征结合,通过序列到序列解码器生成动作序列。
  • 该框架与现有 VLN 模型兼容,可轻松集成至 SOTA 智能体(如 SMNA 和 EnvDrop)中,形成 LEO+。
  • 训练期间应用数据增强以增加指令变体数量,进一步提升泛化能力。

实验结果

研究问题

  • RQ1对多条自然语言指令进行联合推理是否能提升视觉-语言导航中的泛化能力?
  • RQ2通过参数共享的多视角学习在多大程度上减少了语言指令的歧义性?
  • RQ3与单指令训练相比,LEO 在未见环境中的性能提升程度如何?
  • RQ4LEO 是否能有效与现有 SOTA VLN 模型结合,进一步提升性能?
  • RQ5在指令间共享参数是否能防止过拟合并提升对分布偏移的鲁棒性?

主要发现

  • LEO 将贪婪智能体在 R2R 基准测试中的路径长度加权成功率(SPL)从 25.3% 提升至 41.4%,绝对提升 16 个百分点。
  • 应用于 SMNA 智能体时,LEO+ 在 SPL 上实现 9 个百分点的绝对提升,从 53% 提升至 62%。
  • 应用于 EnvDrop 智能体时,LEO+ 在 R2R 测试集上实现 12 个百分点的绝对提升,SPL 达到 62%。
  • LEO 中的共享编码器在未见环境中的泛化能力显著优于多分支编码器,表明过拟合程度更低。
  • 即使在推理阶段仅使用一条指令,LEO 仍优于单指令基线,证明其泛化能力更强。
  • 定性分析表明,LEO 通过多视角的一致性,成功避免了因指令歧义(如在错误时间点执行“向右转”)导致的失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。