Skip to main content
QUICK REVIEW

[论文解读] Multi-modal Discriminative Model for Vision-and-Language Navigation

Haoshuo Huang, Vihan Jain|arXiv (Cornell University)|May 31, 2019
Multimodal Machine Learning Applications参考文献 22被引用 9
一句话总结

本文提出一种多模态判别模型,用于评估视觉语言导航(VLN)中自然语言指令与导航路径之间的对齐程度。通过在廉价挖掘的负样本路径上进行训练,判别器能够从数据增强中识别出高质量的指令-路径配对,从而使得基于其组件初始化的导航智能体在未见环境中的成功率相对提升10%。

ABSTRACT

Vision-and-Language Navigation (VLN) is a natural language grounding task where agents have to interpret natural language instructions in the context of visual scenes in a dynamic environment to achieve prescribed navigation goals. Successful agents must have the ability to parse natural language of varying linguistic styles, ground them in potentially unfamiliar scenes, plan and react with ambiguous environmental feedback. Generalization ability is limited by the amount of human annotated data. In particular, \emph{paired} vision-language sequence data is expensive to collect. We develop a discriminator that evaluates how well an instruction explains a given path in VLN task using multi-modal alignment. Our study reveals that only a small fraction of the high-quality augmented data from \citet{Fried:2018:Speaker}, as scored by our discriminator, is useful for training VLN agents with similar performance on previously unseen environments. We also show that a VLN agent warm-started with pre-trained components from the discriminator outperforms the benchmark success rates of 35.5 by 10\% relative measure on previously unseen environments.

研究动机与目标

  • 解决由于人类标注数据稀缺且昂贵而导致的视觉语言导航(VLN)智能体泛化能力有限的问题。
  • 通过从大规模自动生成的数据增强中识别高质量的指令-路径配对,提升数据效率。
  • 开发一种利用多模态对齐来评估指令-路径一致性的判别模型。
  • 通过使用在判别器上预训练的组件初始化智能体,提升VLN智能体的泛化能力。
  • 提供一种可扩展、高精度的方法,用于过滤噪声数据并提升下游智能体性能,且无需人工标注。

提出的方法

  • 训练判别器以利用多模态对齐,预测给定指令对配对导航路径的解释程度。
  • 使用低成本的负样本采样技术(如路径置换、反转和随机采样)生成负的指令-路径配对。
  • 使用基于对齐的相似性度量训练判别器,以对齐语言和视觉模态之间的对应概念。
  • 微调视觉编码器(例如ResNet-152)和语言编码器(例如Bi-LSTM),以保持多模态表征的保真度。
  • 使用完全训练好的判别器的预训练组件初始化导航智能体,以利用学习到的多模态对齐。
  • 在导航智能体训练过程中应用教学 forcing(student forcing)以稳定学习并改善策略优化。

实验结果

研究问题

  • RQ1判别模型能否有效从大规模机器生成的增强数据中识别出高质量的指令-路径配对?
  • RQ2判别器中的多模态对齐在多大程度上提升了视觉语言导航智能体的泛化能力?
  • RQ3在挖掘的负样本路径上训练的判别器,能在多大程度上提升导航智能体在先前未见环境中的性能?
  • RQ4判别器学习到的对齐能力是否可用于过滤低质量数据或指导VLN中的课程学习?
  • RQ5使用预训练判别器的组件初始化导航智能体,是否能带来比标准训练更好的泛化性能?

主要发现

  • 仅约1%的Fried等人(2018)数据增强结果属于高质量数据,这是由判别器评分所衡量的。
  • 仅使用判别器评分排名前1%的增强数据,即可获得与使用全部增强数据集几乎相同的性能提升。
  • 使用预训练判别器组件初始化的导航智能体,在验证未见数据集上的成功率相对基准提升10%。
  • 定性分析表明,判别器学习到了有意义的多模态对齐,例如将“走出门口”与包含门对象的图像匹配。
  • 同时使用路径置换(PS)和感知相似性(PS)负样本训练的判别器,相比仅使用PS负样本训练的判别器,学习到了更鲁棒、更准确的对齐。
  • 判别器的对齐机制实现了有效的迁移学习,使导航智能体能够更好地泛化到未见环境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。