[论文解读] SemanticPOSS: A Point Cloud Dataset with Large Quantity of Dynamic Instances
本论文提出SemanticPOSS,一个大规模的LiDAR点云数据集,包含2,988个扫描,对14个类别进行逐点和实例级标注,特别强调行人和车辆等动态物体。该数据集在北大校园采集,相比现有数据集(如SemanticKITTI),由于其高密度的动态物体和多样的户外场景,显著提升了深度学习模型在分割动态实例(尤其是行人和车辆)方面的准确性。
3D semantic segmentation is one of the key tasks for autonomous driving system. Recently, deep learning models for 3D semantic segmentation task have been widely researched, but they usually require large amounts of training data. However, the present datasets for 3D semantic segmentation are lack of point-wise annotation, diversiform scenes and dynamic objects. In this paper, we propose the SemanticPOSS dataset, which contains 2988 various and complicated LiDAR scans with large quantity of dynamic instances. The data is collected in Peking University and uses the same data format as SemanticKITTI. In addition, we evaluate several typical 3D semantic segmentation models on our SemanticPOSS dataset. Experimental results show that SemanticPOSS can help to improve the prediction accuracy of dynamic objects as people, car in some degree. SemanticPOSS will be published at \url{www.poss.pku.edu.cn}.
研究动机与目标
- 为解决缺乏大规模、多样化、具备逐点和实例级标注的3D点云数据集以支持动态物体的问题。
- 缓解现有3D语义分割数据集中场景选择偏差和动态物体表征有限的问题。
- 提升深度学习模型在行人和车辆等动态物体上的泛化能力和性能。
- 提供一个与SemanticKITTI兼容的新基准数据集,实现模型训练与评估的无缝衔接。
提出的方法
- 使用LiDAR传感器在北大校园采集数据,捕捉复杂、真实的户外场景,具有高动态物体密度。
- 每个扫描均标注了14个类别的逐点语义标签和实例级标识符,包括行人、骑行人和汽车等。
- 数据格式和接口设计与SemanticKITTI兼容,以确保模型训练时几乎无需重新处理。
- 在SemanticPOSS和SemanticKITTI上对基线模型(包括PointNet++和SqueezeSegV2)进行了性能对比评估。
- 开展了跨数据集泛化实验,以评估模型鲁棒性及训练数据多样性的影响力。
- 该数据集共包含216M个点,分布在2,988个扫描中,平均每帧包含8.29名行人和15.02辆汽车,显著高于SemanticKITTI中的水平。
实验结果
研究问题
- RQ1一个包含丰富动态实例的大规模3D点云数据集,能否显著提升深度学习模型在动态物体分割上的性能?
- RQ23D数据集中场景的多样性在多大程度上影响3D语义分割模型的泛化能力?
- RQ3在高动态物体密度的数据集上进行训练,能在多大程度上提升行人和汽车等类别在IoU指标上的表现?
- RQ4在SemanticPOSS上训练的模型,在其他数据集(如SemanticKITTI)上的泛化性能如何?
主要发现
- 在SemanticPOSS上测试时,模型在行人类别上的IoU从PN-KITTI的0.007提升至PN-POSS的0.208,表明在动态物体检测方面有显著改进。
- 在SemanticPOSS上测试时,PointNet++在SemanticPOSS上训练的mIoU(0.201)优于在SemanticKITTI上训练的同一模型(0.164),表明其在动态实例上的泛化能力更强。
- 跨数据集评估揭示了强烈的场景选择偏差:当在不同数据集间测试时,mIoU显著下降,凸显了多样化训练数据的必要性。
- 即使在SemanticKITTI上测试,SemanticPOSS上训练的模型在动态物体(如行人、车辆)上也表现出更优的性能,表明动态物体数量的增加可增强模型鲁棒性。
- SemanticPOSS平均每帧包含8.29名行人和15.02辆汽车,显著高于SemanticKITTI的0.63和10.09,充分体现了其对动态内容的强调。
- 该数据集与SemanticKITTI的兼容性使得模型可直接迁移,显著降低了研究人员的数据预处理开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。