[论文解读] SESS: Self-Ensembling Semi-Supervised 3D Object Detection
SESS 提出了一种自蒸馏半监督 3D 目标检测框架,通过利用未标注点云,在仅使用 50% 标注数据的情况下提升了检测性能。通过应用全面的扰动方案和三种一致性损失(中心、类别、尺寸),SESS 强制对教师网络与学生网络的预测进行对齐,在 SUN RGB-D 和 ScanNet 上实现了与全监督 SOTA 方法相当的性能。
The performance of existing point cloud-based 3D object detection methods heavily relies on large-scale high-quality 3D annotations. However, such annotations are often tedious and expensive to collect. Semi-supervised learning is a good alternative to mitigate the data annotation issue, but has remained largely unexplored in 3D object detection. Inspired by the recent success of self-ensembling technique in semi-supervised image classification task, we propose SESS, a self-ensembling semi-supervised 3D object detection framework. Specifically, we design a thorough perturbation scheme to enhance generalization of the network on unlabeled and new unseen data. Furthermore, we propose three consistency losses to enforce the consistency between two sets of predicted 3D object proposals, to facilitate the learning of structure and semantic invariances of objects. Extensive experiments conducted on SUN RGB-D and ScanNet datasets demonstrate the effectiveness of SESS in both inductive and transductive semi-supervised 3D object detection. Our SESS achieves competitive performance compared to the state-of-the-art fully-supervised method by using only 50% labeled data. Our code is available at https://github.com/Na-Z/sess.
研究动机与目标
- 解决基于点云的 3D 目标检测中大规模 3D 注释成本高且稀缺的问题。
- 探索仅有一小部分数据被强标注的 3D 目标检测中的半监督学习方法。
- 开发一种框架,有效利用未标注数据中的知识以提升检测精度。
- 设计一种专为点云数据定制的扰动方案,以增强模型泛化能力。
- 引入三种一致性损失,以在教师与学生预测之间强制实现结构与语义的不变性。
提出的方法
- 采用 Mean Teacher 范式,包含一个学生和一个教师 3D 目标检测网络。
- 对点云输入应用全面的扰动方案,包括旋转、缩放和噪声注入。
- 通过三种专用损失强制学生与教师预测之间的一致性:中心感知、类别感知和尺寸感知。
- 使用标注数据和教师网络生成的伪标签预测联合训练学生网络。
- 采用动量更新策略,逐步将教师网络参数从学生网络更新。
- 整合全部三种一致性损失,联合正则化 3D 目标检测中的几何与语义信息。
实验结果
研究问题
- RQ1自蒸馏技术在半监督图像分类中的应用能否有效适配到点云的 3D 目标检测任务?
- RQ2定制化的扰动方案如何提升 3D 半监督检测中的泛化能力?
- RQ3几何(中心、尺寸)与语义(类别)一致性对模型性能的相对贡献如何?
- RQ4SESS 是否能在仅使用 50% 标注数据的情况下达到与全监督方法相当的性能?
- RQ5该框架是否能在不同 3D 检测设置中泛化,包括归纳和归纳外场景?
主要发现
- 在 SUN RGB-D 上,SESS 仅使用 50% 标注数据即达到 40.7% 的平均 mAP,在 ScanNetV2 上达到 52.0%,性能与全监督 SOTA 方法相当。
- 三种一致性损失(中心、类别、尺寸)的联合使用表现最佳,表明它们在提升检测精度方面具有互补作用。
- 中心感知和类别感知的一致性损失贡献更大,尽管三种损失均提升了最终结果。
- 在 ScanNet 上,SESS 使用 30% 标注数据即可检测出 26/27 把椅子和全部 7 张桌子,优于全监督的 VoteNet(仅检测出 24 把椅子和 6 张桌子)。
- 定性结果表明,SESS 生成的 3D 检测框更准确且更一致,甚至能检测到未标注但符合人类感知的物体。
- 消融实验确认,扰动方案增强了模型鲁棒性,其中缩放和旋转扰动在各数据集上均带来了最一致的性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。