Skip to main content
QUICK REVIEW

[论文解读] Object-oriented Targets for Visual Navigation using Rich Semantic Representations

Jean-Benoit Delbrouck, Stéphane Dupont|arXiv (Cornell University)|Nov 22, 2018
Multimodal Machine Learning Applications参考文献 9被引用 4
一句话总结

本文提出了一种基于丰富语义表征的面向对象视觉导航框架,以提升在未见过环境中的泛化能力。通过在自然语言和空间定位的物体中心目标上进行训练,该方法在新目标和新场景上的零样本泛化性能优于基线模型,收敛速度更快,尤其在对高置信度语义帧进行微调后表现更优。

ABSTRACT

When searching for an object humans navigate through a scene using semantic information and spatial relationships. We look for an object using our knowledge of its attributes and relationships with other objects to infer the probable location. In this paper, we propose to tackle the visual navigation problem using rich semantic representations of the observed scene and object-oriented targets to train an agent. We show that both allows the agent to generalize to new targets and unseen scene in a short amount of training time.

研究动机与目标

  • 利用语义知识提升视觉导航在未见目标和环境中的泛化能力。
  • 通过引入场景类型特定的策略头,解决先前模型依赖场景特定微调的局限性。
  • 利用自然语言描述和物体定位,实现对环境更丰富的理解。
  • 评估语义先验是否能提升对新目标和新场景类型的零样本迁移性能。

提出的方法

  • 模型采用共享视觉编码器(ResNet-50)的孪生网络(SN),并为厨房、卧室、浴室和客厅等场景类型设计特定的策略头。
  • 训练期间使用面向对象的目标,使智能体学习将目标物体与其语义属性和空间关系相关联。
  • 引入一个语义组件,将视觉特征与密集字幕输出(DenseCap)结合,生成每帧345维的语义向量。
  • 通过学习的矩阵 $\bm{W}_{1^\prime}$ 将语义输入投影到512维嵌入空间,与视觉特征融合,形成联合表征。
  • 模型采用强化学习进行端到端训练,稀疏密集奖励机制下,成功定义为在1000步内抵达目标。
  • 一种变体(SSN_S)在每场景的五个最高置信度DenseCap帧上进行训练,提升了语义定位质量。

实验结果

研究问题

  • RQ1使用富含语义表征的面向对象目标,能否提升在已知场景中未见过目标的零样本泛化能力?
  • RQ2与标准仅视觉基线相比,通过DenseCap引入语义定位是否能增强对未见场景的泛化能力?
  • RQ3在高置信度语义帧上训练(SSN_S)与在标准面向对象目标上训练(SSN)相比,泛化性能如何?
  • RQ4场景类型特定的策略共享在提升相同场景类型不同实例间迁移能力方面有多大的作用?
  • RQ5与随机或与物体无关的目标相比,语义先验是否能实现更快的收敛速度和更高的成功率?

主要发现

  • 语义模型(SSN)在浴室任务T2(未见场景泛化)中达到94.1%的成功率,显著优于基线SN(17.4%)和先前工作[12](71.4%)。
  • 在任务T1(已见场景中未见目标泛化)中,SSN在卧室中达到61.9%成功率,浴室中为92.4%,厨房中为31.5%,客厅中为18.1%,显著优于SN基线。
  • 在顶级语义目标上训练(SSN_S)显著提升了所有场景类型的成功率,卧室达66.2%,浴室达94.1%,表明高置信度语义帧可增强泛化能力。
  • 在面向对象目标上训练的模型(SSN)优于随机目标,收敛更快,且在未见目标上成功率更高,即使目标为无物体(如墙面或走廊)也表现良好。
  • SSN_S变体在每场景的五个最可信DenseCap帧上训练,浴室中达到最高94.1%成功率,并在所有场景类型中均一致优于标准SSN。
  • 模型在零样本迁移中表现出强鲁棒性:即使仅使用1000万帧训练数据(排除每种场景类型的一个实例),在客厅任务T2中仍达到90.1%的成功率,展现出强大的泛化潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。