[论文解读] Lidar-Camera Co-Training for Semi-Supervised Road Detection
本文提出了一种基于深度神经网络的激光雷达-相机协同训练框架,用于半监督道路检测,其中相机和激光雷达模型基于相互预测结果,迭代地对未标注数据进行自标注。该方法在仅使用36个标注样本的情况下,在KITTI基准上实现了最先进性能,相较于监督学习,F1分数提升了2.61个百分点。
Recent advances in the field of machine learning and computer vision have enabled the development of fast and accurate road detectors. Commonly such systems are trained within a supervised learning paradigm where both an input sensor's data and the corresponding ground truth label must be provided. The task of generating labels is commonly carried out by human annotators and it is notoriously time consuming and expensive. In this work, it is shown that a semi-supervised approach known as co-training can provide significant F1-score average improvements compared to supervised learning. In co-training, two classifiers acting on different views of the data cooperatively improve each other's performance by leveraging unlabeled examples. Depending on the amount of labeled data used, the improvements ranged from 1.12 to 6.10 percentage points for a camera-based road detector and from 1.04 to 8.14 percentage points for a lidar-based road detector. Lastly, the co-training algorithm is validated on the KITTI road benchmark, achieving high performance using only 36 labeled training examples together with several thousands unlabeled ones.
研究动机与目标
- 为解决自动驾驶中道路分割数据标注的高成本与高工作量问题。
- 通过利用大量未标注数据,在有限标注数据下提升道路检测性能。
- 通过协同训练框架,充分利用相机与激光雷达传感器的互补特性。
- 在KITTI道路基准上,使用极少标注数据验证该方法的有效性。
- 证明基于两种模态专用网络的协同训练可显著优于监督学习方法。
提出的方法
- 一种改进的协同训练算法在标注数据上交替训练基于相机和基于激光雷达的全卷积神经网络(FCN),并利用未标注数据的置信预测进行自标注。
- 每个模型对未标注样本的预测结果被用作伪标签,以训练另一模型,从而利用模态间的互补性(例如,激光雷达对光照不敏感,相机提供丰富的纹理信息)。
- 该算法使用置信度阈值选择最可靠的预测结果(前p个正样本和前n个负样本)用于每轮迭代中的自标注。
- 该过程在标注数据上的监督训练与未标注数据上的协同训练之间交替进行,通过同时优化监督损失和无监督损失实现联合优化。
- 该方法在KITTI数据集上应用,使用36个标注帧和6,445个未标注帧,模型通过Adam优化器训练并采用早停策略。
- 最终模型仅在相机数据上进行评估,以模拟仅部署相机的真实世界场景。
实验结果
研究问题
- RQ1在仅使用极少标注数据的情况下,相机与激光雷达模型之间的协同训练能否显著提升道路检测性能?
- RQ2协同训练带来的性能增益如何随不同数量的标注数据而变化?
- RQ3该协同训练框架能否在仅使用少量标注集的情况下,泛化到真实世界基准(如KITTI)?
- RQ4互补传感器之间的相互自标注是否能提升在复杂条件(如光照不良)下的鲁棒性?
- RQ5所提出方法在KITTI基准上与最先进监督和半监督方法相比表现如何?
主要发现
- 在不同标注数据规模下,协同训练方法使基于相机的检测器F1分数提升了1.12至6.10个百分点。
- 对于基于激光雷达的检测器,F1分数提升了1.04至8.14个百分点,表明在有限监督下具有显著增益。
- 在KITTI基准上,协同训练的相机模型(RGB36-Cotrain)达到95.55%的F1分数,相较于监督基线(92.94%)提升了2.61个百分点。
- 尽管仅使用36个标注训练样本,RGB36-Cotrain在KITTI URBAN_ROAD类别中排名第四,位列已发表方法之中。
- 定性结果表明,与监督基线相比,协同训练模型在处理复杂光照和路面条件时表现更优。
- 该方法表明,通过利用互补传感器的协同训练来挖掘未标注数据,可大幅降低标注成本,同时保持或提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。