Skip to main content
QUICK REVIEW

[论文解读] HDMapNet: An Online HD Map Construction and Evaluation Framework

Qi Li, Yue Wang|arXiv (Cornell University)|Jul 13, 2021
Advanced Image and Video Retrieval Techniques被引用 8
一句话总结

HDMapNet 提出了一种基于传感器的在线框架,可实时使用车载摄像头和/或激光雷达构建高精(HD)语义地图,通过一种新型视角变换器将2D图像特征投影到鸟瞰图,实现矢量化地图预测。该方法在所有指标上相比先前方法均有50%的相对性能提升,其中相机-激光雷达融合模型在实例检测和语义分割任务上分别优于基线方法12.1 mAP和13.1 mAP。

ABSTRACT

Constructing HD semantic maps is a central component of autonomous driving. However, traditional pipelines require a vast amount of human efforts and resources in annotating and maintaining the semantics in the map, which limits its scalability. In this paper, we introduce the problem of HD semantic map learning, which dynamically constructs the local semantics based on onboard sensor observations. Meanwhile, we introduce a semantic map learning method, dubbed HDMapNet. HDMapNet encodes image features from surrounding cameras and/or point clouds from LiDAR, and predicts vectorized map elements in the bird's-eye view. We benchmark HDMapNet on nuScenes dataset and show that in all settings, it performs better than baseline methods. Of note, our camera-LiDAR fusion-based HDMapNet outperforms existing methods by more than 50% in all metrics. In addition, we develop semantic-level and instance-level metrics to evaluate the map learning performance. Finally, we showcase our method is capable of predicting a locally consistent map. By introducing the method and metrics, we invite the community to study this novel map learning problem.

研究动机与目标

  • 解决传统高精地图构建中依赖人工标注与维护所导致的可扩展性差和人力成本高的问题。
  • 开发一种在线、实时的框架,直接从车载传感器数据学习局部语义地图,无需预先构建的全局地图。
  • 设计一种从透视视图到鸟瞰图的鲁棒特征投影机制,能够处理深度不确定性,并利用相机外参。
  • 采用语义级和实例级指标联合评估地图学习性能,实现不同方法间的公平比较。
  • 证明生成局部一致、矢量化语义地图的可行性,适用于实时运动规划。

提出的方法

  • HDMapNet 使用多分支网络处理来自环视摄像头和/或激光雷达点云的图像特征,通过一种新型视角变换器将其投影到鸟瞰图。
  • 视角变换器结合神经特征变换与几何投影,显式建模相机外参,隐式建模三维结构,无需显式深度估计。
  • 特征融合模块结合摄像头与激光雷达的表征,利用各自优势——摄像头在纹理和色彩对比方面表现优异,激光雷达在高程变化的几何精度方面更优。
  • 通过独立的头部预测矢量化地图元素(如车道线、隔离带、人行横道),分别执行语义分割、实例检测和方向分类。
  • 通过融合自车位姿的特征拼接实现时序融合,提升长时间序列下的鲁棒性与一致性。
  • 后处理通过主成分分析(PCA)与方向掩码,将预测的嵌入特征转换为平滑、连续的矢量化曲线。
Figure 1 : In contrast to pre-annotating global semantic maps, we introduce a novel local map learning framework that makes use of on-board sensors to estimate local semantic maps.
Figure 1 : In contrast to pre-annotating global semantic maps, we introduce a novel local map learning framework that makes use of on-board sensors to estimate local semantic maps.

实验结果

研究问题

  • RQ1深度学习模型能否有效实现实时从原始摄像头和激光雷达输入直接预测高精语义地图?
  • RQ2所提出的视角变换器在准确性和鲁棒性方面与传统IPM或基于深度估计的方法相比表现如何?
  • RQ3摄像头与激光雷达模态在预测不同地图元素时,其互补性体现在多大程度?
  • RQ4多帧时序融合在动态或低能见度条件下能否提升地图一致性并降低噪声?
  • RQ5语义级与实例级评估指标如何共同反映地图学习模型的性能?

主要发现

  • 基于相机-激光雷达融合的HDMapNet在所有指标上均优于现有方法50%以上,语义分割任务上mAP提升12.1,实例检测任务上提升13.1,显著优于基线方法。
  • HDMapNet(Surr)优于所有单模态基线模型,包括IPM和Lift-Splat-Shoot,在实例检测任务上mAP相对提升达55.4%。
  • 模型在恶劣天气下仍保持合理性能:雨天IoU仅降至38.7,夜间降至39.3,同时仍能生成完整的车道线预测。
  • 两帧及以上时序融合使IoU从32.9提升至36.4,长期累积可生成更大、更一致的语义地图。
  • CD(中心距离)指标揭示了互补行为:部分模型在精确率(CD P)上表现优异,另一些在召回率(CD L)上更优,而HDMapNet(Surr)实现了最佳平衡。
  • 可视化结果证实,模型学习到了实例级嵌入与方向感知特征,生成的矢量化曲线平滑连续,适用于路径规划。
Figure 2 : Model overview. HDMapNet works with either or both of images and point clouds, outputs semantic segmentation, instance embedding and directions, and finally produces a vectorized local semantic map. Top left: image branch. Bottom left: point cloud branch. Right: HD semantic map. .
Figure 2 : Model overview. HDMapNet works with either or both of images and point clouds, outputs semantic segmentation, instance embedding and directions, and finally produces a vectorized local semantic map. Top left: image branch. Bottom left: point cloud branch. Right: HD semantic map. .

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。