Skip to main content
QUICK REVIEW

[论文解读] Pseudo-labeling for Scalable 3D Object Detection

Benjamin Caine, Rebecca Roelofs|arXiv (Cornell University)|Mar 2, 2021
Advanced Neural Network Applications参考文献 55被引用 5
一句话总结

本文提出了一种用于3D目标检测的伪标签方法,利用大规模未标注LiDAR数据显著提升性能,且无需修改网络架构。通过在有限标注数据上训练一个强大的教师模型,并将其预测结果通过伪标签蒸馏到学生模型中,该方法在Waymo Open Dataset上取得了SOTA结果——车辆的L1 AP为74.0,行人L1 AP为69.8,优于在3–10倍更多标注数据上训练的监督模型,并在Kirkland等新领域上表现出良好的泛化能力。

ABSTRACT

To safely deploy autonomous vehicles, onboard perception systems must work reliably at high accuracy across a diverse set of environments and geographies. One of the most common techniques to improve the efficacy of such systems in new domains involves collecting large labeled datasets, but such datasets can be extremely costly to obtain, especially if each new deployment geography requires additional data with expensive 3D bounding box annotations. We demonstrate that pseudo-labeling for 3D object detection is an effective way to exploit less expensive and more widely available unlabeled data, and can lead to performance gains across various architectures, data augmentation strategies, and sizes of the labeled dataset. Overall, we show that better teacher models lead to better student models, and that we can distill expensive teachers into efficient, simple students. Specifically, we demonstrate that pseudo-label-trained student models can outperform supervised models trained on 3-10 times the amount of labeled examples. Using PointPillars [24], a two-year-old architecture, as our student model, we are able to achieve state of the art accuracy simply by leveraging large quantities of pseudo-labeled data. Lastly, we show that these student models generalize better than supervised models to a new domain in which we only have unlabeled data, making pseudo-label training an effective form of unsupervised domain adaptation.

研究动机与目标

  • 为解决在新地理区域中为自动驾驶车辆感知系统收集3D边界框标注所面临的高昂成本与可扩展性障碍。
  • 探究通过伪标签实现的半监督学习是否能在极少架构修改的情况下提升3D目标检测性能。
  • 评估伪标签方法在低资源或域外设置(如Kirkland)下的域泛化有效性。
  • 识别在3D检测中伪标签训练的最佳实践,包括教师模型质量与数据增强策略。
  • 证明从高性能教师模型蒸馏到高效学生模型(如PointPillars)可实现SOTA结果,且无需引入新的架构设计。

提出的方法

  • 采用两阶段训练流程:首先在少量人工标注的3D目标检测数据上训练教师模型。
  • 训练好的教师模型在大规模未标注LiDAR数据上生成伪标签,为点云中的点分配预测的边界框。
  • 学生模型(具体为两年前的PointPillars架构)在原始标注数据与伪标注数据的并集上进行训练。
  • 学生模型使用标准检测损失函数进行训练,除增加伪标注样本外,未进行任何架构修改或超参数调优。
  • 在训练过程中应用数据增强以提升模型鲁棒性与泛化能力,尤其在学生模型训练阶段。
  • 在多个领域(包括域内:旧金山、山景城、凤凰城;域外:Kirkland)对方法进行评估,以衡量其域适应性能。

实验结果

研究问题

  • RQ1当仅有少量标注数据时,伪标签方法是否能显著提升3D目标检测性能?
  • RQ2伪标签方法是否能增强模型在无任何标注数据的新地理领域中的泛化能力?
  • RQ3教师模型的质量如何影响伪标签流程中学生模型的性能?
  • RQ4在3D检测中,为最大化伪标签收益,最优的训练配置是什么?包括数据增强与训练调度策略。
  • RQ5当学生模型(如PointPillars)为简单轻量级架构时,是否仍能通过伪标签训练实现SOTA性能,即使其在监督训练设置下被更复杂模型超越?

主要发现

  • 使用伪标签数据训练的学生模型在Waymo Open Dataset测试集上,车辆的L1 AP达到74.0,行人的L1 AP达到69.8,分别比监督基线模型高出+5.4和+1.9 AP。
  • 同一学生模型在SF/MTV/PHX域中,优于在3–10倍更多标注数据上训练的监督模型,车辆与行人的AP分别提升+9.8和+11.2。
  • 在Kirkland域适应挑战中,伪标签学生模型的车辆L1 AP为56.2,行人L1 AP为36.1,分别比监督基线高出+7.9和+4.5 AP。
  • 性能增益在不同数据增强策略和模型架构下均保持稳定,表明该方法具有良好的泛化能力。
  • 提升教师模型的架构设计与推理质量可带来更好的学生模型性能,证实教师质量是蒸馏成功的关键因素。
  • 采用简单、非迭代的伪标签方法(使用硬标签,无软标签或多次训练迭代)取得了最佳结果,与其它自监督学习任务中的发现相矛盾。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。