[论文解读] OVO: Open-Vocabulary Occupancy
OVO 提出了一种新颖的、与模型无关的开放词汇 3D 语义占据预测框架,该框架在训练过程中无需 3D 标注。通过利用预训练的 2D 开放词汇分割模型进行知识蒸馏,并应用像素-体素过滤以选择高质量的体素,OVO 在 NYUv2 和 SemanticKITTI 数据集上实现了具有竞争力的性能,能够通过任意文本查询实现对新物体类别的零样本预测。
Semantic occupancy prediction aims to infer dense geometry and semantics of surroundings for an autonomous agent to operate safely in the 3D environment. Existing occupancy prediction methods are almost entirely trained on human-annotated volumetric data. Although of high quality, the generation of such 3D annotations is laborious and costly, restricting them to a few specific object categories in the training dataset. To address this limitation, this paper proposes Open Vocabulary Occupancy (OVO), a novel approach that allows semantic occupancy prediction of arbitrary classes but without the need for 3D annotations during training. Keys to our approach are (1) knowledge distillation from a pre-trained 2D open-vocabulary segmentation model to the 3D occupancy network, and (2) pixel-voxel filtering for high-quality training data generation. The resulting framework is simple, compact, and compatible with most state-of-the-art semantic occupancy prediction models. On NYUv2 and SemanticKITTI datasets, OVO achieves competitive performance compared to supervised semantic occupancy prediction approaches. Furthermore, we conduct extensive analyses and ablation studies to offer insights into the design of the proposed framework. Our code is publicly available at https://github.com/dzcgaara/OVO.
研究动机与目标
- 解决现有 3D 语义占据模型因依赖昂贵且预定义的 3D 标注而带来的可扩展性限制,这些标注仅针对一组固定的物体类别。
- 实现对训练期间未见过的任意语义类别的零样本预测,克服当前占据网络中的标签集瓶颈问题。
- 开发一种简单、紧凑且兼容的框架,可与最先进占据预测模型配合使用,而无需从头开始重新训练。
- 探究从 2D 开放词汇模型到 3D 占据网络的知识蒸馏在零样本泛化中的有效性。
- 分析训练数据质量对模型性能的影响,特别是通过体素过滤和特征对齐的影响。
提出的方法
- 将预训练的 2D 开放词汇分割模型(LSeg)的知识蒸馏应用于 3D 占据网络,将语义理解迁移至 3D 空间。
- 引入三阶段特征对齐过程:体素-像素对齐、体素-文本对齐和像素-像素对齐,以对齐 2D 图像特征与 3D 体素特征及文本嵌入。
- 在体素-像素对齐过程中应用重加权,以降低来自 2D 模型的噪声或低置信度预测的影响,提升训练稳定性和性能。
- 采用多阶段体素过滤机制,通过移除图像外、被遮挡或跨视图不一致的体素,选择高质量的训练体素。
- 该框架设计为与模型无关,可与现有占据网络(如 MonoScene)兼容,仅需少量架构修改。
- 在推理阶段使用文本查询,可预测任意语义类别的占据情况,实现对训练标签集之外类别的零样本泛化。

实验结果
研究问题
- RQ1从预训练的 2D 开放词汇模型中进行知识蒸馏,是否能有效将语义理解迁移至 3D 占据预测,而无需使用 3D 标注?
- RQ2训练体素的质量如何影响零样本 3D 语义占据预测的性能?
- RQ3所提出的特征对齐模块中各组件(体素-像素、体素-文本、像素-像素)对最终性能的贡献如何?
- RQ4对噪声预测进行重加权在多大程度上能改善蒸馏过程和模型泛化能力?
- RQ5所提出的框架能否泛化至训练数据中不存在的新物体类别,包括描述模糊或罕见的类别?
主要发现
- 在 NYUv2 数据集的新类别上,OVO 实现了 20.15% 的平均交并比(mIoU),显著优于无 3D 标注的基线方法。
- 消融实验表明,在体素-像素对齐中引入重加权可使 mIoU 提升 2.49 个百分点,凸显其在降低噪声方面的重要性。
- 同时应用三种体素过滤机制(图像外、被遮挡、不一致)后,训练体素数量从 270 万减少至 36 万,mIoU 提升 5.78 个百分点,证明质量优于数量。
- 与基础的 MonoScene 模型相比,添加 OVO 模块仅使计算成本增加 14%,展现出高效率。
- 定性结果表明,OVO 在低可见度或视图外场景下仍能成功预测新类别,如 'bed'(床)、'table'(桌)、'car'(汽车)和 'road'(道路)。
- 模型对开放词汇查询(如 'object'(物体)或 'furniture'(家具))具有良好的泛化能力,展示了强大的零样本能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。