[论文解读] Omni3D: A Large Benchmark and Model for 3D Object Detection in the Wild
本文提出了 Omni3D,一个包含 234k 张图像、300 万个 3D 物体实例、涵盖 98 个类别的大规模基准数据集,并提出了 Cube R-CNN,一种统一的 3D 物体检测器,通过引入虚拟深度来缓解尺度-深度模糊性,从而在不同场景和相机类型之间实现良好泛化。该模型在 KITTI 上相比之前最先进方法最高提升 9.5% AP,在 Omni3D 上提升 7.9% AP,并实现了对未见领域(如 COCO)的零样本泛化能力。
Recognizing scenes and objects in 3D from a single image is a longstanding goal of computer vision with applications in robotics and AR/VR. For 2D recognition, large datasets and scalable solutions have led to unprecedented advances. In 3D, existing benchmarks are small in size and approaches specialize in few object categories and specific domains, e.g. urban driving scenes. Motivated by the success of 2D recognition, we revisit the task of 3D object detection by introducing a large benchmark, called Omni3D. Omni3D re-purposes and combines existing datasets resulting in 234k images annotated with more than 3 million instances and 98 categories. 3D detection at such scale is challenging due to variations in camera intrinsics and the rich diversity of scene and object types. We propose a model, called Cube R-CNN, designed to generalize across camera and scene types with a unified approach. We show that Cube R-CNN outperforms prior works on the larger Omni3D and existing benchmarks. Finally, we prove that Omni3D is a powerful dataset for 3D object recognition and show that it improves single-dataset performance and can accelerate learning on new smaller datasets via pre-training.
研究动机与目标
- 解决现有 3D 物体检测基准在城市驾驶或室内场景等狭窄领域之外缺乏大规模、多样化数据集的问题。
- 开发一种能够跨不同相机内参、场景类型和物体类别的统一 3D 物体检测模型。
- 通过引入虚拟深度作为归一化技术,减少多领域 3D 检测中的尺度-深度模糊性。
- 证明在 Omni3D 上进行预训练可提升在较小、特定领域基准上的性能。
- 通过发布可扩展的基准数据集和高效的评估工具,加速 3D 检测研究。
提出的方法
- Omni3D 通过重新利用和整合现有数据集(SUN RGB-D、ARKitScenes、Hypersim、Objectron、KITTI 和 nuScenes)构建而成,共包含 234k 张图像和 300 万个 3D 框标注,覆盖 98 个类别。
- 提出一种新型算法,3D 交并比(IoU)计算速度提升 450 倍,从而实现对大规模基准数据集的高效评估。
- Cube R-CNN 是一种统一的、端到端的 3D 物体检测器,基于基于 Transformer 的主干网络和 3D 区域提议机制,从单张图像中预测 3D 位置、尺寸和方向。
- 引入虚拟深度作为归一化策略:所有图像被投影到具有固定内参的统一虚拟相机空间中,以减少因焦距差异导致的尺度-深度模糊性。
- 通过虚拟深度支持图像重缩放等数据增强技术,提升泛化能力和训练稳定性。
- 模型在完整 Omni3D 数据集上端到端训练,并在多个基准上进行评估,包括对 COCO 等未见领域的零样本迁移。
实验结果
研究问题
- RQ1单一 3D 物体检测器是否能在具有不同相机内参和物体类别的多样化真实场景中实现有效泛化?
- RQ2在类似 Omni3D 的大规模多领域基准上进行预训练,能否显著提升在较小、特定领域 3D 检测基准上的性能?
- RQ3在焦距可变的单目 3D 检测中,虚拟深度在多大程度上能缓解尺度-深度模糊性?
- RQ4统一模型是否能超越在 KITTI 或 SUN RGB-D 等单一数据集上训练的专用模型?
- RQ5高效的 3D IoU 计算对大规模 3D 检测基准的训练与评估可扩展性有何影响?
主要发现
- 在 KITTI 基准上,Cube R-CNN 相比之前最先进方法 GUPNet 提升了 9.5% AP。
- 在 Omni3D 基准上,Cube R-CNN 相比 PGD 提升 7.9% AP,展现出在多样化场景中的强大泛化能力。
- 在 Omni3D 上进行预训练,可使单个数据集的性能在城市类基准上提升最高 5.3% AP,在室内类基准上提升 3.8% AP。
- 所提出的 3D IoU 计算算法相比之前方法快 450 倍,实现了大规模数据集上训练与评估的高效化。
- Cube R-CNN 对未见领域具有良好的泛化能力,在 COCO 图像上实现零样本检测,尤其在室内场景中表现优异。
- 在 Omni3D 的长尾类别上性能下降,AP3D 从顶部 50 个类别的 23.3% 降至全部 98 个类别的 14.1%,凸显了少样本 3D 识别的挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。