Skip to main content
QUICK REVIEW

[论文解读] SF-UDA$^{3D}$: Source-Free Unsupervised Domain Adaptation for LiDAR-Based 3D Object Detection

Cristiano Saltori, Stéphane Lathuilière|arXiv (Cornell University)|Oct 16, 2020
Advanced Neural Network Applications参考文献 48被引用 10
一句话总结

该论文提出 SF-UDA3D,这是首个面向基于 LiDAR 的 3D 目标检测的无源域自适应框架,通过可逆缩放变换与运动一致性伪标注,使预训练的 PointRCNN 检测器在无法访问源数据或目标标注的情况下,适应到新的目标域。该方法实现了最先进性能,在从 nuScenes 到 KITTI 的迁移中将域差距减少了 66%,在从 KITTI 到 nuScenes 的迁移中减少了 30%。

ABSTRACT

3D object detectors based only on LiDAR point clouds hold the state-of-the-art on modern street-view benchmarks. However, LiDAR-based detectors poorly generalize across domains due to domain shift. In the case of LiDAR, in fact, domain shift is not only due to changes in the environment and in the object appearances, as for visual data from RGB cameras, but is also related to the geometry of the point clouds (e.g., point density variations). This paper proposes SF-UDA$^{3D}$, the first Source-Free Unsupervised Domain Adaptation (SF-UDA) framework to domain-adapt the state-of-the-art PointRCNN 3D detector to target domains for which we have no annotations (unsupervised), neither we hold images nor annotations of the source domain (source-free). SF-UDA$^{3D}$ is novel on both aspects. Our approach is based on pseudo-annotations, reversible scale-transformations and motion coherency. SF-UDA$^{3D}$ outperforms both previous domain adaptation techniques based on features alignment and state-of-the-art 3D object detection methods which additionally use few-shot target annotations or target annotation statistics. This is demonstrated by extensive experiments on two large-scale datasets, i.e., KITTI and nuScenes.

研究动机与目标

  • 解决基于 LiDAR 的 3D 目标检测中因点云几何结构、物体外观及环境条件差异而产生的域偏移问题。
  • 应对实际部署场景中源数据和标注通常不可用的限制。
  • 开发一种仅需预训练源模型和未标注目标数据的域自适应方法,无需任何目标标注或源数据访问。
  • 提升 3D 检测器在不同城市、天气条件或 LiDAR 传感器类型等域之间的泛化能力。

提出的方法

  • 通过对输入数据应用多种缩放变换,为未标注的目标点云生成伪标注,使预训练的 PointRCNN 模型能够在不同分辨率下检测物体。
  • 使用可逆缩放变换以保持空间关系,并在检测后实现一致的标签聚合。
  • 利用无监督运动一致性度量——平均体积变化(MVV)——评估预测物体轨迹在帧间的稳定性和可靠性。
  • 对 MVV 施加惩罚项(MVV*),以过滤掉短时或不稳定的轨迹,从而提升在噪声较大的数据集(如 nuScenes)上的鲁棒性。
  • 基于置信度分数,聚合各尺度下表现最佳的检测标签,并用于在目标域上微调 PointRCNN 模型。
  • 利用检测轨迹的时间一致性来识别高质量的伪标签,即使在缺乏真实标注的情况下亦可实现。

实验结果

研究问题

  • RQ1当源数据和标注不可用时,无源无监督域自适应框架是否能有效将 3D 目标检测器适配到新的目标域?
  • RQ2可逆缩放变换在提升点云密度和几何结构差异较大的目标域上的检测性能方面效果如何?
  • RQ3无监督运动一致性度量(如 MVV 和 MVV*)是否能可靠地识别高质量的伪标注而无需真实标注监督?
  • RQ4在基于 LiDAR 的 3D 检测域自适应中,多尺度伪标注相较于单尺度检测的性能优势有多大?
  • RQ5与需要少量目标标注或目标统计信息的最先进方法相比,所提方法表现如何?

主要发现

  • 在从 nuScenes 到 KITTI 的迁移中,SF-UDA3D 将域差距减少了 66%,显著优于现有方法。
  • 在更具挑战性的 KITTI 到 nuScenes 迁移中,SF-UDA3D 修复了 30% 的性能差距,展现出对域偏移的强鲁棒性。
  • 即使在无任何目标标注的情况下,该方法仍比以往的无源特征级域自适应方法高出 30% 的性能。
  • 带有最小长度惩罚的 MVV* 度量在噪声更大的 nuScenes 数据集上显著提升性能,优于 TEX 和标准 MVV。
  • 使用表现最佳的三个缩放因子对目标点云进行重缩放,可使源模型的性能从 0.202 提升至 0.394 Avg-AP,充分体现了多尺度伪标注的价值。
  • 通过多尺度聚合的伪标签进行微调可获得最高性能,证实了多尺度策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。