Skip to main content
QUICK REVIEW

[论文解读] OpenScene: 3D Scene Understanding with Open Vocabularies

Songyou Peng, Kyle Genova|arXiv (Cornell University)|Nov 28, 2022
Advanced Image and Video Retrieval Techniques被引用 10
一句话总结

OpenScene 通过在 CLIP 的视觉-语言特征空间中联合嵌入 3D 点云特征与文本及图像像素,提出了一种零样本、任务无关的 3D 场景理解方法。该方法支持开放词汇查询——如识别柔软表面、功能属性或房间类型——且无需任何标注的 3D 数据,实现了 SOTA 的零样本 3D 语义分割性能,并支持文本驱动的 3D 物体搜索和场景探索等新型应用。

ABSTRACT

Traditional 3D scene understanding approaches rely on labeled 3D datasets to train a model for a single task with supervision. We propose OpenScene, an alternative approach where a model predicts dense features for 3D scene points that are co-embedded with text and image pixels in CLIP feature space. This zero-shot approach enables task-agnostic training and open-vocabulary queries. For example, to perform SOTA zero-shot 3D semantic segmentation it first infers CLIP features for every 3D point and later classifies them based on similarities to embeddings of arbitrary class labels. More interestingly, it enables a suite of open-vocabulary scene understanding applications that have never been done before. For example, it allows a user to enter an arbitrary text query and then see a heat map indicating which parts of a scene match. Our approach is effective at identifying objects, materials, affordances, activities, and room types in complex 3D scenes, all using a single model trained without any labeled 3D data.

研究动机与目标

  • 实现无需依赖标注 3D 数据集的开放词汇 3D 场景理解。
  • 允许用户使用任意文本或图像提示查询 3D 场景的语义、材质、功能属性和用途。
  • 开发一个统一模型,通过单一的零样本框架支持多种场景理解任务。
  • 克服传统监督式 3D 分割模型受限于固定、封闭类别集的局限性。
  • 证明利用预训练 CLIP 嵌入实现鲁棒、可泛化的 3D 场景理解的可行性。

提出的方法

  • 该方法通过混合 2D-3D 网络架构,在 CLIP 的共享特征空间中联合嵌入 3D 点特征、图像像素和文本。
  • 通过将 3D 点反投影到带姿态的 RGB 图像中,建立 3D 到 2D 的对应关系,并聚合多视角像素特征。
  • 训练一个稀疏 3D 卷积网络,以预测与聚合后的 2D 像素特征对齐的 3D 点特征,损失函数为对比损失。
  • 最终的 3D 点特征为融合后的 2D 特征与 3D 网络输出的集成,结合几何与外观线索。
  • 特征提取后,通过计算 3D 点特征与文本或图像查询的 CLIP 嵌入之间的余弦相似度,执行开放词汇查询。
  • 该方法支持对任意文本或图像查询的零样本推理,包括 'soft'(柔软)、'hot'(发热)或 'playable'(可玩)等属性,无需微调。

实验结果

研究问题

  • RQ1是否可以仅使用预训练的 CLIP 特征,在无需任何标注 3D 数据的情况下实现 3D 场景理解?
  • RQ2单一模型是否能够支持如材质属性、功能属性和功能等多样化、开放词汇的查询?
  • RQ3该零样本方法在具有大量类别标签的任务上,与完全监督模型相比性能如何?
  • RQ4该模型是否能在不重新训练的情况下泛化到具有不同标签集的新数据集?
  • RQ5该模型是否能支持新型应用,如基于文本的 3D 物体搜索和交互式场景探索?

主要发现

  • OpenScene 在标准基准上实现了 SOTA 的零样本 3D 语义分割性能,在 40、80 或 160 个类别的任务上优于完全监督模型。
  • 该模型成功检索出与任意文本查询(如 'soft'(柔软)、'kitchen'(厨房)或 'work'(工作))匹配的 3D 点,生成了准确的匹配区域热力图。
  • 对于 10 个稀有物体类别,该模型在首次错误前检索出所有但两个真实实例,实现了 100% 的精确率,展现出强大的开放词汇检索能力。
  • 该模型识别出 26 个在真实标签中未被正确标注的实例,包括 13 个电话,表明其在检测稀有或模糊实例方面优于人工标注。
  • 成功演示了基于图像的 3D 物体检测,能够根据图像查询正确识别出池桌和餐桌等物体。
  • 该模型支持新型应用,如查询物理属性(如 'hot'(发热)、'comfy'(舒适))、材质以及潜在活动(如 'play'(可玩)),这些在标准监督方法中难以实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。