Skip to main content
QUICK REVIEW

[论文解读] Towards Learning a Generic Agent for Vision-and-Language Navigation via Pre-training

Weituo Hao, Chunyuan Li|arXiv (Cornell University)|Feb 25, 2020
Multimodal Machine Learning Applications参考文献 32被引用 18
一句话总结

本文提出 Prevalent,一种视觉-语言导航智能体,通过在图像-文本-动作三元组上进行自监督预训练,学习通用且可迁移的表征。通过采用掩码语言建模和动作预测目标进行预训练,Prevalent 在三个 VLN 基准上取得最先进性能——在 R2R 上将成功率达到 51%,并在 CVND 和 HANNA 上创下新 SOTA,同时在未见环境中的泛化能力更强,并在微调过程中适应更快。

ABSTRACT

Learning to navigate in a visual environment following natural-language instructions is a challenging task, because the multimodal inputs to the agent are highly variable, and the training data on a new task is often limited. In this paper, we present the first pre-training and fine-tuning paradigm for vision-and-language navigation (VLN) tasks. By training on a large amount of image-text-action triplets in a self-supervised learning manner, the pre-trained model provides generic representations of visual environments and language instructions. It can be easily used as a drop-in for existing VLN frameworks, leading to the proposed agent called Prevalent. It learns more effectively in new tasks and generalizes better in a previously unseen environment. The performance is validated on three VLN tasks. On the Room-to-Room benchmark, our model improves the state-of-the-art from 47% to 51% on success rate weighted by path length. Further, the learned representation is transferable to other VLN tasks. On two recent tasks, vision-and-dialog navigation and "Help, Anna!" the proposed Prevalent leads to significant improvement over existing methods, achieving a new state of the art.

研究动机与目标

  • 通过从大规模多模态数据中学习通用且可迁移的表征,解决视觉-语言导航(VLN)中训练数据有限且模糊的挑战。
  • 通过引入一种将语言和视觉理解与动作序列对齐的预训练范式,减少对特定任务预训练的依赖。
  • 通过统一的预训练编码器,实现对未见环境的更好泛化和对新任务的更快适应。
  • 通过提供一种通用且可重用的表征模型,实现与现有 VLN 框架的即插即用集成。
  • 验证在下游 VLN 任务中,结合动作的预训练与图像注意力掩码语言建模的有效性。

提出的方法

  • 在 R2R 数据集收集的大规模图像-文本-动作三元组上,使用自监督学习范式预训练视觉-语言模型。
  • 采用两种预训练目标:在视觉特征上使用交叉注意力的掩码语言建模(MLM),以及未来动作预测(PA),以对齐语言与未来动作。
  • 将预训练编码器作为固定特征提取器使用,或在下游 VLN 任务中端到端微调,从而实现与现有模型的即插即用兼容性。
  • 将预训练模型应用于三个下游任务:房间到房间(R2R)、协作视觉-对话导航(CVND)和“帮帮安娜!”(HANNA)。
  • 采用两阶段训练策略:首先从预训练编码器中提取固定特征,然后微调交叉注意力层以提升性能。
  • 设计 MLM 目标时,在掩码过程中引入视觉特征注意力,与标准 BERT 式预训练区分开来,增强多模态对齐。

实验结果

研究问题

  • RQ1在图像-文本-动作三元组上进行自监督预训练,能否提升视觉-语言导航中的零样本泛化能力?
  • RQ2与从零开始训练或使用标准 BERT 相比,通过动作预测和掩码语言建模进行预训练,是否能带来更好的性能和更快的适应速度?
  • RQ3预训练的视觉-语言表征在多样化 VLN 任务中(包括同域和跨域设置)的迁移能力有多强?
  • RQ4与随机初始化或标准微调相比,预训练在减少过拟合并提升未见环境中的性能方面有何优势?
  • RQ5在导航任务中,图像注意力掩码语言建模是否比标准 BERT 式 MLM 更有效?

主要发现

  • Prevalent 在 R2R 基准上达到新 SOTA,成功率达到 51%,相较之前 SOTA 的 47% 显著提升。
  • 在协作视觉-对话导航(CVND)任务中,Prevalent 显著优于现有方法,展现出对跨域任务的强大迁移能力。
  • 在“帮帮安娜!”(HANNA)基准中,Prevalent 在提交时的公开结果中表现最佳,证实其在交互式导航中的有效性。
  • 预训练模型实现了更快的适应和更好的泛化能力,学习曲线显示收敛更快,且在已见与未见环境之间的性能差距更小。
  • 消融实验证实,掩码语言建模和动作预测目标均对性能有贡献,其中图像注意力 MLM 比标准 BERT 预训练更有效。
  • 基于特征的微调方法表现优异,而两阶段训练方案(先特征提取,再交叉注意力微调)在 R2R 上进一步提升了性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。