Skip to main content
QUICK REVIEW

[论文解读] Are You Looking? Grounding to Multiple Modalities in Vision-and-Language Navigation

Ronghang Hu, Daniel Fried|arXiv (Cornell University)|Jun 2, 2019
Multimodal Machine Learning Applications参考文献 35被引用 13
一句话总结

本文研究视觉-语言导航(VLN)中的视觉定位问题,发现视觉特征会损害最先进模型的泛化能力。为改善多模态定位,作者提出一种专家混合框架,结合视觉(CNN与目标检测)和非视觉(仅路径结构)智能体,使R2R验证未见分割的准确率提升至51.9%,较基线模型高出逾10个百分点。

ABSTRACT

Vision-and-Language Navigation (VLN) requires grounding instructions, such as "turn right and stop at the door", to routes in a visual environment. The actual grounding can connect language to the environment through multiple modalities, e.g. "stop at the door" might ground into visual objects, while "turn right" might rely only on the geometric structure of a route. We investigate where the natural language empirically grounds under two recent state-of-the-art VLN models. Surprisingly, we discover that visual features may actually hurt these models: models which only use route structure, ablating visual features, outperform their visual counterparts in unseen new environments on the benchmark Room-to-Room dataset. To better use all the available modalities, we propose to decompose the grounding procedure into a set of expert models with access to different modalities (including object detections) and ensemble them at prediction time, improving the performance of state-of-the-art models on the VLN task.

研究动机与目标

  • 探究最先进VLN模型中语言定位发生的位置——具体而言,性能提升是否源于视觉外观、路径结构,或两者兼有。
  • 评估在当前模型严重依赖视觉输入的前提下,视觉特征是否真能提升对未见环境的泛化能力。
  • 通过引入泛化能力优于低级CNN特征的高层目标表示,改进多模态定位。
  • 设计一种模态特异性智能体(视觉与非视觉)的互补集成,其性能优于单一模型基线。
  • 证明共享编码器下模态特异性解码器的联合训练可进一步提升性能。

提出的方法

  • 作者训练两种最先进VLN模型(Speaker-Follower与Self-Monitoring)时去除视觉特征,以隔离路径结构的贡献。
  • 引入使用预训练目标检测器生成的高层目标表示,以提升对像素级CNN特征的泛化能力。
  • 设计一种专家混合框架,分别训练视觉与非视觉智能体,每类智能体专精于特定模态,并在推理时集成其预测结果。
  • 实验对比推理时集成与共享单指令编码器的多个解码器联合训练策略,每个解码器关注不同模态。
  • 在R2R基准上评估性能,尤其关注验证未见分割,以衡量对新环境的泛化能力。
  • 对比消融模型,包括仅视觉、仅非视觉及混合模型,以分离各模态及其组合的影响。

实验结果

研究问题

  • RQ1最先进VLN模型在多大程度上将语言定位到视觉外观,而非路径结构?
  • RQ2包含视觉特征是否真能提升对未见环境的泛化能力,还是反而降低性能?
  • RQ3与低级CNN特征相比,高层目标表示能否改善视觉定位的泛化能力?
  • RQ4将专精于不同模态(视觉与非视觉)的智能体组合,是否能带来优于单一模型或同模态集成的性能提升?
  • RQ5共享编码器下模态特异性解码器的联合训练,是否优于独立训练智能体的推理时集成?

主要发现

  • 在R2R验证未见分割上,无视觉特征的模型(非视觉智能体)的成功率与视觉模型相当或更优,表明视觉特征可能损害泛化能力。
  • 表现最佳的模型为结合ResNet CNN特征、目标检测结果与非视觉路径结构的专家混合模型,在R2R验证未见分割上达到51.9%的成功率,较基线模型高出逾10个百分点。
  • 专家混合方法优于同模态智能体的集成,证实视觉与非视觉智能体提供互补性改进。
  • 在视觉模型中加入基于目标的表示,相较仅使用CNN的视觉模型,性能提升2.6%,表明高层视觉表示具有更强的泛化能力。
  • 共享编码器下多个解码器的联合训练性能优于独立训练智能体的推理时集成,表明联合优化可增强模态融合。
  • 51.9%的成功率在验证已见分割上保持不变,表明在已见环境中无性能退化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。