Skip to main content
QUICK REVIEW

[论文解读] H3DNet: 3D Object Detection Using Hybrid Geometric Primitives

Zaiwei Zhang, Bo Sun|arXiv (Cornell University)|Jun 10, 2020
3D Shape Modeling and Analysis参考文献 53被引用 17
一句话总结

H3DNet 提出了一种新颖的3D目标检测框架,从无颜色的3D点云中回归一组混合几何基元——边界框(BB)中心、面中心和边中心。通过定义可微分的距离函数以实现对目标提议的连续优化,并利用匹配与精炼模块对检测结果进行分类与微调,H3DNet 在 ScanNet(67.2% mAP@0.25)和 SUN RGB-D(60.1% mAP@0.25)上实现了最先进性能,尤其在具有挑战性的类别上取得了显著提升。

ABSTRACT

We introduce H3DNet, which takes a colorless 3D point cloud as input and outputs a collection of oriented object bounding boxes (or BB) and their semantic labels. The critical idea of H3DNet is to predict a hybrid set of geometric primitives, i.e., BB centers, BB face centers, and BB edge centers. We show how to convert the predicted geometric primitives into object proposals by defining a distance function between an object and the geometric primitives. This distance function enables continuous optimization of object proposals, and its local minimums provide high-fidelity object proposals. H3DNet then utilizes a matching and refinement module to classify object proposals into detected objects and fine-tune the geometric parameters of the detected objects. The hybrid set of geometric primitives not only provides more accurate signals for object detection than using a single type of geometric primitives, but it also provides an overcomplete set of constraints on the resulting 3D layout. Therefore, H3DNet can tolerate outliers in predicted geometric primitives. Our model achieves state-of-the-art 3D detection results on two large datasets with real 3D scans, ScanNet and SUN RGB-D.

研究动机与目标

  • 提升在复杂、真实世界场景中、具有不规则点云输入和可变目标数量的3D目标检测性能。
  • 通过利用过完备的几何基元集合,解决3D检测中噪声或不精确几何线索的挑战。
  • 通过整合多样化的几何信号(中心、面、边)并实现对目标提议的稳健连续优化,提升检测精度。
  • 开发一种统一的、端到端的深度学习框架,联合回归几何基元、生成提议并精炼带语义标签的检测结果。
  • 证明混合几何基元回归相比单一基元或非几何方法,能带来更鲁棒、更准确的3D目标检测。

提出的方法

  • H3DNet 从3D点云中的密集点特征中回归三种几何基元:BB中心、BB面中心和BB边中心。
  • 它定义了一个参数化距离函数,用于度量候选3D边界框与预测几何基元之间的距离,从而实现对目标提议的连续优化。
  • 该距离函数的局部极小值对应高保真度的目标提议,通过可微分优化过程进行精炼。
  • 匹配与精炼模块将提议分类为检测到的对象,预测几何偏移量(中心、尺寸、方向),并利用匹配基元的聚合潜在特征分配语义标签。
  • 网络采用多个特征计算塔来处理多样的几何线索,并支持每个对象的可变基元数量。
  • 对匹配基元的特征聚合通过结合互补的几何与语义信号,提升了检测置信度和几何精度。

实验结果

研究问题

  • RQ1与仅使用单一基元类型相比,混合几何基元(中心、面、边)是否能提升3D目标检测性能?
  • RQ2通过可微分距离函数实现对目标提议的连续优化,是否能带来比离散或非优化提议生成更高的检测质量?
  • RQ3过完备的几何基元集合是否能提升对真实世界3D扫描中预测误差和异常值的鲁棒性?
  • RQ4多种基元类型的整合如何影响在具有显著几何结构差异的挑战性物体类别上的检测精度?
  • RQ5从匹配的几何基元中进行特征聚合,在多大程度上能增强检测对象的分类与精炼效果?

主要发现

  • 在 ScanNet 上,H3DNet 达到 67.2% mAP@0.25,相比仅使用3D点位置的最先进方法实现了 8.5% 的相对性能提升。
  • 在 SUN RGB-D 上,H3DNet 达到 60.1% mAP@0.25,相比相同基线方法实现了 2.4% 的相对性能提升。
  • 在困难类别上的性能提升尤为显著:在 ScanNet 上,窗户类(38.1% → 51.9%)、门类(47.3% → 61.0%)和淋浴帘类(57.1% → 75.3%)的性能均有显著改善。
  • 若移除对几何参数(中心、尺寸、角度、存在性或语义分数)的精炼,ScanNet 上的 mAP@0.5 将下降 14.6%,证明了精炼过程的关键作用。
  • 仅使用边或面基元会导致某些类别性能欠佳——例如,仅使用边基元的检测在淋浴帘类上完全失败,而仅使用面基元的检测在窗户类上表现不佳——凸显了混合基元的优势。
  • 增加更多特征计算塔可提升性能(例如,mAP@0.25 从 64.4 提升至 67.2),但超过四个塔后性能增益递减,表明存在收益递减现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。