[论文解读] InsMapper: Exploring Inner-instance Information for Vectorized HD Mapping
InsightMapper 提出了一种基于 Transformer 的新型框架,通过显式建模预测地图点之间的实例内相关性,实现在线向量化的高精地图检测。它引入了混合查询生成、通过自注意力机制实现的实例内查询融合,以及一个掩码的实例内自注意力模块,在 NuScenes 数据集上相比 SOTA 方法实现了 5.78 mAP 和 7.03 TOPO 的性能提升,同时保持了高效的训练与推理速度。
Vectorized high-definition (HD) maps contain detailed information about surrounding road elements, which are crucial for various downstream tasks in modern autonomous vehicles, such as motion planning and vehicle control. Recent works attempt to directly detect the vectorized HD map as a point set prediction task, achieving notable detection performance improvements. However, these methods usually overlook and fail to analyze the important inner-instance correlations between predicted points, impeding further advancements. To address this issue, we investigate the utilization of inner-instance information for vectorized high-definition mapping through transformers, and propose a powerful system named $ extbf{InsMapper}$, which effectively harnesses inner-instance information with three exquisite designs, including hybrid query generation, inner-instance query fusion, and inner-instance feature aggregation. The first two modules can better initialize queries for line detection, while the last one refines predicted line instances. InsMapper is highly adaptable and can be seamlessly modified to align with the most recent HD map detection frameworks. Extensive experimental evaluations are conducted on the challenging NuScenes and Argoverse 2 datasets, where InsMapper surpasses the previous state-of-the-art method, demonstrating its effectiveness and generality. The project page for this work is available at https://tonyxuqaq.github.io/InsMapper/ .
研究动机与目标
- 为解决现有向量化高精地图检测方法无法利用同一道路要素实例内点之间相关性的问题。
- 提升在线、基于传感器的高精地图生成中的拓扑正确性与检测 mAP。
- 在训练与推理过程中保持高效率,支持自动驾驶系统中的实时部署。
- 探究实例内信息对地图表征与预测质量的影响。
- 设计一种基于 Transformer 的架构,显式建模实例内依赖关系,以提升在复杂城市场景下的泛化能力。
提出的方法
- 引入混合查询生成,通过解耦实例间关系,仅保留实例内相关性,从而提升查询质量。
- 采用自注意力机制实现实例内查询融合,聚合同一实例下各查询的特征,增强表征一致性。
- 在解码器中集成掩码的实例内自注意力模块,实现对每个实例内部的聚焦特征聚合,注意力范围被限制在实例内点之间。
- 模型采用两阶段集合预测范式,类似于 DETR,但对结构关系建模进行了改进,以显式捕捉地图要素内部的结构关联。
- 架构在保持 DETR 类模型端到端可微性与高效性的同时,增加了实例感知的建模组件。
- 该框架在 NuScenes 与 Argoverse-2 数据集上进行训练与评估,采用标准的 mAP 与拓扑正确性(TOPO)指标。
实验结果
研究问题
- RQ1对预测地图点之间的实例内相关性进行建模,是否能显著提升向量化高精地图检测性能?
- RQ2在端到端地图检测中,引入实例内依赖关系对拓扑正确性与 mAP 的影响如何?
- RQ3如何最优地生成与融合对象查询,以保留实例特异性关系?
- RQ4聚焦于实例内点的掩码自注意力机制是否能提升特征表征与检测性能?
- RQ5能否在不牺牲训练或推理效率的前提下实现此类实例感知建模?
主要发现
- InsightMapper 在 NuScenes 验证集上取得 48.31 mAP 与 51.58 TOPO 的性能,分别超越此前 SOTA 方法 MapTR 5.78 mAP 与 7.03 TOPO。
- 消融实验表明,混合查询生成显著优于朴素与分层方案,较分层基线提升 1.38 mAP 与 1.42 TOPO。
- 基于自注意力的查询融合表现最佳(48.31 mAP,51.58 TOPO),优于平均融合与前馈融合。
- 掩码的实例内自注意力模块至关重要:移除该模块后,mAP 下降 2.89 点,TOPO 下降 2.39 点,证实其有效性。
- 模型保持了高效率,每轮训练时间仅增加 0.01–0.03 小时,推理 FPS 与 MapTR 相同,即使增加了额外模块。
- 在 Argoverse-2 数据集上,InsightMapper 同样取得一致改进,尽管因场景复杂度较低,提升幅度较小,验证了其在不同领域的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。