Skip to main content
QUICK REVIEW

[论文解读] Weakly-Supervised Multi-Granularity Map Learning for Vision-and-Language Navigation

Peihao Chen, Dongyu Ji|arXiv (Cornell University)|Oct 14, 2022
Multimodal Machine Learning Applications被引用 16
一句话总结

该论文提出 WS-MGMap,一种用于视觉-语言导航的弱监督多粒度地图方法,通过整合细粒度视觉细节(如颜色、纹理)和语义类别,构建自顶向下的地图。通过引入一种基于路径的粗粒度监督的弱监督物体定位辅助任务,模型能够更准确地表示与指令相关的物体,在 VLN-CE 数据集的已见和未见环境中,成功率分别比当前最先进方法高出 4.0% 和 4.6%。

ABSTRACT

We address a practical yet challenging problem of training robot agents to navigate in an environment following a path described by some language instructions. The instructions often contain descriptions of objects in the environment. To achieve accurate and efficient navigation, it is critical to build a map that accurately represents both spatial location and the semantic information of the environment objects. However, enabling a robot to build a map that well represents the environment is extremely challenging as the environment often involves diverse objects with various attributes. In this paper, we propose a multi-granularity map, which contains both object fine-grained details (e.g., color, texture) and semantic classes, to represent objects more comprehensively. Moreover, we propose a weakly-supervised auxiliary task, which requires the agent to localize instruction-relevant objects on the map. Through this task, the agent not only learns to localize the instruction-relevant objects for navigation but also is encouraged to learn a better map representation that reveals object information. We then feed the learned map and instruction to a waypoint predictor to determine the next navigation goal. Experimental results show our method outperforms the state-of-the-art by 4.0% and 4.6% w.r.t. success rate both in seen and unseen environments, respectively on VLN-CE dataset. Code is available at https://github.com/PeihaoChen/WS-MGMap.

研究动机与目标

  • 为解决现有语义地图在表示颜色、纹理和材质等细粒度物体属性方面的局限性,这些属性对精准导航至关重要。
  • 通过引入一种弱监督辅助任务,减少对昂贵人工标注的依赖,实现基于地图的物体定位。
  • 通过学习一种能同时捕捉语义信息与细粒度细节的判别性地图表示,提升视觉-语言导航的零样本泛化能力。
  • 实现对指令相关物体更鲁棒的定位,特别是那些被标准分割模型误分类的物体。

提出的方法

  • 将从 U-Net 编码器最后一层提取的细粒度视觉特征(保留丰富的纹理和颜色信息)附加到标准语义地图上。
  • 将分割模型中高维潜在特征从该层投影到自顶向下的自身视角地图,形成多粒度表示。
  • 引入一个弱监督定位头,仅利用路径接近度作为监督信号,预测指令相关物体的位置,避免人工标注。
  • 利用代理轨迹生成粗粒度定位真实标签——路径附近的区域被视为相关物体的正样本。
  • 通过端到端学习,联合训练地图编码器与航路点预测器,其中辅助任务提升地图表示的导航性能。
  • 采用标准的现成局部策略,执行低层级动作(如前进、转向)以朝向预测的航路点移动。

实验结果

研究问题

  • RQ1结合语义类别与细粒度视觉特征的多粒度地图,能否提升视觉-语言导航性能?
  • RQ2仅使用基于路径的监督信号的弱监督定位辅助任务,是否能在无需人工物体标注的前提下提升地图表示?
  • RQ3所提方法能否更准确地定位被标准分割模型误分类的物体,例如将红色地毯误认为地板?
  • RQ4该方法在未见环境中的泛化能力如何,特别是在处理复杂指令相关物体描述时?

主要发现

  • 所提出的 WS-MGMap 方法在 VLN-CE 基准测试中,于已见环境中相比最先进方法取得了 4.0% 的更高成功率。
  • 在未见环境中,该方法相比当前最先进方法成功率达到 4.6% 的提升,展现出强大的零样本泛化能力。
  • 使用 U-Net 编码器最后一层的特征表现最佳,在所有指标上均优于第一层、中间层和分类层的特征。
  • 消融实验表明,弱监督定位任务显著提升了定位准确率,尤其在语义标签模糊的物体(如“红色地毯”)上效果明显。
  • 定性结果证实,WS-MGMap 比基线方法更精确地定位指令相关物体,尤其在分割模型失效的场景中(如将红色地毯误认为地板)。
  • 该模型能有效学习颜色、纹理等细粒度属性,从而更好地区分相似物体(如两幅餐桌)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。