[论文解读] Object2Scene: Putting Objects in Context for Open-Vocabulary 3D Detection
Object2Scene 提出了一种新颖的框架,通过从大规模、多样化且词汇量庞大的3D物体数据集中插入大型3D物体,丰富3D场景数据集,生成精确的3D边界框和语言定位提示,从而实现开放词汇的3D物体检测。该方法在OV-ScanNet-200基准上实现了最先进性能,mAP_{25}达到24.62%,其核心在于采用跨域对比学习和统一的检测-定位模型(L3Det)。
Point cloud-based open-vocabulary 3D object detection aims to detect 3D categories that do not have ground-truth annotations in the training set. It is extremely challenging because of the limited data and annotations (bounding boxes with class labels or text descriptions) of 3D scenes. Previous approaches leverage large-scale richly-annotated image datasets as a bridge between 3D and category semantics but require an extra alignment process between 2D images and 3D points, limiting the open-vocabulary ability of 3D detectors. Instead of leveraging 2D images, we propose Object2Scene, the first approach that leverages large-scale large-vocabulary 3D object datasets to augment existing 3D scene datasets for open-vocabulary 3D object detection. Object2Scene inserts objects from different sources into 3D scenes to enrich the vocabulary of 3D scene datasets and generates text descriptions for the newly inserted objects. We further introduce a framework that unifies 3D detection and visual grounding, named L3Det, and propose a cross-domain category-level contrastive learning approach to mitigate the domain gap between 3D objects from different datasets. Extensive experiments on existing open-vocabulary 3D object detection benchmarks show that Object2Scene obtains superior performance over existing methods. We further verify the effectiveness of Object2Scene on a new benchmark OV-ScanNet-200, by holding out all rare categories as novel categories not seen during training.
研究动机与目标
- 解决开放词汇3D物体检测的挑战,即模型需检测在训练中未标注的类别。
- 克服以往基于2D图像的方法依赖2D-3D对齐所导致的定位性能差和领域差距问题。
- 利用大规模3D物体数据集(如ShapeNet、OmniObject3D)作为多样化、未标注3D物体的来源,以丰富3D场景数据集。
- 缓解在仅对已见类别进行标注的场景中插入未见类别物体时产生的标注不一致问题。
- 开发统一模型L3Det,能够同时执行3D物体检测与3D语言定位,利用文本提示提升零样本泛化能力。
提出的方法
- 利用物理可及性与参考物体引导,在3D场景点云中插入来自大规模3D物体数据集的3D物体,确保其放置的合理性。
- 生成语言定位提示(如“一个桌子位于房间中央靠近一株植物”),以消除类别标签歧义,实现对插入物体的精确定位。
- 对插入的3D物体进行归一化与重采样,使其尺度与分布与目标场景数据集对齐,降低领域偏移。
- 提出一种基于Transformer的统一模型L3Det,联合执行3D物体检测与3D语言定位,输入为点云与文本。
- 引入跨域类别级对比学习,对齐来自不同数据集(如ShapeNet与ScanNet)的物体特征表示,减少领域差距。
- 在训练中应用数据增强技术(如旋转、点云丢弃、抖动),以提升模型鲁棒性与泛化能力。
实验结果
研究问题
- RQ1能否在不依赖2D图像监督的前提下,有效利用大规模3D物体数据集来丰富3D场景数据集,以支持开放词汇3D物体检测?
- RQ2在训练数据构建中,如何缓解仅标注原始场景物体而未标注插入的新类别物体所导致的标注不一致问题?
- RQ3何种类型的语言提示(检测提示、绝对位置提示、相对位置提示)最有利于开放词汇3D物体检测中的零样本泛化?
- RQ4跨域类别级对比学习在多大程度上能减少来自不同数据集的3D物体之间的领域偏移?
- RQ5从多个来源(如ShapeNet与OmniObject3D)插入的3D物体多样性在多大程度上影响模型的开放词汇检测性能?
主要发现
- Object2Scene在OV-ScanNet-200基准上实现了24.62%的mAP_{25},其中所有稀有类别在训练阶段均作为新类别保留,证明了其强大的零样本泛化能力。
- 同时使用ShapeNet与OmniObject3D作为外部物体来源,使mAP_{25}从11.21%提升至24.62%,表明物体多样性显著提升性能。
- 随机化3D物体放置使mAP_{25}提升2.83个百分点(从18.48%增至21.31%),表明随机放置带来的数据多样性可增强模型鲁棒性。
- 相对位置提示(如“一张椅子靠近一张桌子”)的mAP_{25}最高,达21.31%,优于检测提示与绝对位置提示,因其能更有效地消除物体角色歧义。
- 物体归一化与重采样使mAP_{25}从2.34%提升至6.41%,凸显源数据集与目标数据集之间特征分布对齐的重要性。
- 在归一化与数据增强后应用跨域类别级对比学习,使mAP_{25}从7.34%提升至11.21%,证明其在减小领域差距方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。