Skip to main content
QUICK REVIEW

[论文解读] MCD: Diverse Large-Scale Multi-Campus Dataset for Robot Perception

Thien‐Minh Nguyen, Shenghai Yuan|arXiv (Cornell University)|Mar 18, 2024
Advanced Neural Network Applications被引用 4
一句话总结

本论文提出了MCD,一个大规模、多校区的数据集,包含多样化的传感模态——包括低成本NRE激光雷达、摄像头、IMU和UWB——以及针对59,000次NRE扫描中29个类别的逐点语义标注。该工作通过基于优化的激光雷达-惯性匹配方法,在测绘级地图上构建了新型的连续时间真实值,揭示了当SOTA 3D语义分割模型应用于NRE激光雷达时,其性能显著下降(mIoU下降超过25%),凸显了在泛化性和鲁棒性方面面临的关键挑战。

ABSTRACT

Perception plays a crucial role in various robot applications. However, existing well-annotated datasets are biased towards autonomous driving scenarios, while unlabelled SLAM datasets are quickly over-fitted, and often lack environment and domain variations. To expand the frontier of these fields, we introduce a comprehensive dataset named MCD (Multi-Campus Dataset), featuring a wide range of sensing modalities, high-accuracy ground truth, and diverse challenging environments across three Eurasian university campuses. MCD comprises both CCS (Classical Cylindrical Spinning) and NRE (Non-Repetitive Epicyclic) lidars, high-quality IMUs (Inertial Measurement Units), cameras, and UWB (Ultra-WideBand) sensors. Furthermore, in a pioneering effort, we introduce semantic annotations of 29 classes over 59k sparse NRE lidar scans across three domains, thus providing a novel challenge to existing semantic segmentation research upon this largely unexplored lidar modality. Finally, we propose, for the first time to the best of our knowledge, continuous-time ground truth based on optimization-based registration of lidar-inertial data on large survey-grade prior maps, which are also publicly released, each several times the size of existing ones. We conduct a rigorous evaluation of numerous state-of-the-art algorithms on MCD, report their performance, and highlight the challenges awaiting solutions from the research community.

研究动机与目标

  • 为解决机器人感知领域在自动驾驶场景之外缺乏多样化、大规模且标注完善的基准数据集的问题。
  • 推动针对低成本、非重复性环扫(NRE)激光雷达的研究,该模态因点云稀疏性和扫描不规则性,在语义分割领域仍处于未充分探索状态。
  • 通过将激光雷达-惯性数据与测绘级先验地图进行优化,提供高精度、连续时间的真实值,以支持SLAM与定位研究。
  • 通过暴露光照变化、玻璃反光和非视 Line-of-Sight UWB效应等挑战,促进鲁棒感知算法的发展。
  • 通过在三个地理与环境特征各异的大学校区采集数据,支持域泛化研究。

提出的方法

  • 数据集采集自亚洲、欧洲和德国的三所大学校区,覆盖多样的环境条件与建筑风格。
  • 集成多种传感器:传统旋转式激光雷达(CCS)、基于MEMS的NRE激光雷达、高频IMU、多基线RGB摄像头以及UWB信标。
  • 针对59,000次NRE激光雷达扫描,人工创建了29个物体类别的语义标注,使其成为该模态首个大规模语义数据集。
  • 通过非线性优化框架,将激光雷达-惯性轨迹与预先构建的高精度测绘级地图进行对齐,生成连续时间真实值。
  • 真实值支持任意时间点与密度的采样,可为AR/VR和实时机器人应用提供高保真度评估。
  • 数据集包含运动失真与运动校正后的激光雷达数据,使研究人员能够研究运动模糊对感知模型的影响。

实验结果

研究问题

  • RQ1在圆柱形激光雷达上训练的SOTA 3D语义分割模型,能否泛化到NRE激光雷达的稀疏且不规则的点云上?
  • RQ2不同校区之间的域移位如何影响现有SLAM与感知算法的性能?
  • RQ3原始NRE激光雷达扫描中的运动失真在多大程度上会降低感知系统的性能?又该如何缓解?
  • RQ4连续时间真实值在大规模环境中能否提升SLAM与定位的精度与可靠性?
  • RQ5太阳能干扰、玻璃反光和极端光照等环境挑战如何影响感知系统的鲁棒性?

主要发现

  • 所有SOTA 3D语义分割模型在NRE激光雷达扫描上的测试表现相比在SemanticKITTI上训练的结果,mIoU相对下降超过25%,表明其对该模态的泛化能力极差。
  • 依赖圆柱形或投影表示的方法(如SalsaNext、Cylinder3D)因与NRE点云模式不兼容,性能下降最为严重。
  • 体素化模型(如MKNet、SPVCNN)也表现出显著的性能下降,主要源于CCS与NRE激光雷达之间点云密度的差异。
  • 仅有WaffleIron和S-Former在NRE扫描上实现了超过50%的mIoU,得益于其灵活的、逐点的表示学习能力,可适应不规则扫描模式。
  • 在另一所校区(TUHH)测试时,所有模型相比其在NTU校区的表现,性能相对下降超过70%,表明存在强烈的域移位现象,且跨环境泛化能力差。
  • 本研究揭示了当前感知模型在处理真实世界挑战(如太阳能干扰、玻璃反光、非视 Line-of-Sight UWB效应)方面存在关键短板,而这些挑战在现有基准中均未充分体现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。