Skip to main content
QUICK REVIEW

[论文解读] Semantic MapNet: Building Allocentric Semantic Maps and Representations from Egocentric Views

Vincent Cartillier, Zhile Ren|arXiv (Cornell University)|Oct 2, 2020
Robotics and Sensor-Based Localization被引用 13
一句话总结

语义地图网络(SMNet)提出了一种新颖的框架,用于从已知相机位姿的自上而下视角RGB-D观测中构建环境中心(allocentric)语义地图。通过编码自上而下的特征,利用已知的相机几何关系将这些特征投影到空间记忆张量中,并解码为语义地图,SMNet实现了最先进性能,在Matterport3D数据集上的平均交并比(mean-IoU)上优于基线方法4.01%–16.81%,在边界F1分数(Boundary-F1)上优于基线方法3.81%–19.69%。

ABSTRACT

We study the task of semantic mapping - specifically, an embodied agent (a robot or an egocentric AI assistant) is given a tour of a new environment and asked to build an allocentric top-down semantic map ("what is where?") from egocentric observations of an RGB-D camera with known pose (via localization sensors). Towards this goal, we present SemanticMapNet (SMNet), which consists of: (1) an Egocentric Visual Encoder that encodes each egocentric RGB-D frame, (2) a Feature Projector that projects egocentric features to appropriate locations on a floor-plan, (3) a Spatial Memory Tensor of size floor-plan length x width x feature-dims that learns to accumulate projected egocentric features, and (4) a Map Decoder that uses the memory tensor to produce semantic top-down maps. SMNet combines the strengths of (known) projective camera geometry and neural representation learning. On the task of semantic mapping in the Matterport3D dataset, SMNet significantly outperforms competitive baselines by 4.01-16.81% (absolute) on mean-IoU and 3.81-19.69% (absolute) on Boundary-F1 metrics. Moreover, we show how to use the neural episodic memories and spatio-semantic allocentric representations build by SMNet for subsequent tasks in the same space - navigating to objects seen during the tour("Find chair") or answering questions about the space ("How many chairs did you see in the house?"). Project page: https://vincentcartillier.github.io/smnet.html.

研究动机与目标

  • 使具身智能体能够从已知位姿的自上而下RGB-D观测中构建精确、度量化的环境中心(allocentric)自上而下语义地图。
  • 学习可复用的神经情景记忆与时空语义表征,以支持下游任务如导航与问答。
  • 克服现有方法的局限性,这些方法存在标签扩散(label splatter,即投影分割标签)或信息丢失(使用俯视图像)的问题。
  • 将投影几何与深度神经表征学习相结合,以提升空间与语义的准确性。
  • 在未见环境中展示所学表征在下游任务(如ObjectNav与语义问答)中的实用性。

提出的方法

  • 自上而下视觉编码器处理每一帧RGB-D图像,以提取自上而下参考系中的深层视觉特征。
  • 特征投影器利用已知的相机位姿与深度信息,将这些自上而下的特征映射到2D平面图上的对应位置。
  • 大小为H×W×D的空间记忆张量随时间累积投影后的特征,以保持空间与语义的一致性。
  • 地图解码器使用可学习的解码头,从空间记忆张量中重建自上而下的语义地图。
  • 模型通过监督学习进行端到端训练,以真实自上而下的语义地图作为监督信号。
  • 所学表征可进行微调或直接用于下游任务,如ObjectNav与语义问答。

实验结果

研究问题

  • RQ1神经网络能否有效结合自上而下的视觉特征与已知的相机几何关系,以构建精确的环境中心语义地图?
  • RQ2与标签扩散方法相比,为何投影特征而非标签能提升分割质量?
  • RQ3所学的神经情景记忆在多大程度上能支持导航与语义推理等下游任务?
  • RQ4自由空间地图中的误差与语义地图中的误差,对下游导航性能的相对影响如何?
  • RQ5该模型能否泛化到未见环境中,并以高精度支持如“找椅子”或“有多少把椅子?”等任务?

主要发现

  • SMNet在Matterport3D语义地图基准上,相较于竞争性基线方法,平均交并比(mean-IoU)绝对提升4.01%–16.81%。
  • 模型在边界F1分数(Boundary-F1)上绝对提升3.81%–19.69%,表明对物体边界的定位能力更强。
  • 在ObjectNav任务中,使用真实自由空间图与预测语义图时,SMNet的成功率为0.6913,SPL为0.4993。
  • 当自由空间图与语义图均由模型预测时,成功率下降0.5759,SPL下降0.4324,表明自由空间预测是主要误差来源。
  • 仅使用预测的语义图即可在ObjectNav任务中实现优异性能(在完整验证集上成功率为0.3125),表明其对下游任务具有高度实用性。
  • 按房屋分析显示,SMNet在多样化环境中泛化良好,各房屋的软SPL得分在0.087至0.384之间,表明对结构差异具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。