Skip to main content
QUICK REVIEW

[论文解读] GOOD: Exploring Geometric Cues for Detecting Objects in an Open World

Haiwen Huang, Andreas Geiger|arXiv (Cornell University)|Dec 22, 2022
Advanced Neural Network Applications被引用 5
一句话总结

GOOD 提出了一种基于几何引导的开放世界目标检测框架,利用预训练单目估计器生成的深度图和法线图作为几何线索,以提升对新型目标类别检测的性能。通过在训练过程中利用这些几何线索为未标注目标生成伪标签,GOOD 在 COCO 数据集上仅使用一个基础类别(如 'person')时,相比最先进方法实现了 5.0% 的绝对 AR@100 提升。

ABSTRACT

We address the task of open-world class-agnostic object detection, i.e., detecting every object in an image by learning from a limited number of base object classes. State-of-the-art RGB-based models suffer from overfitting the training classes and often fail at detecting novel-looking objects. This is because RGB-based models primarily rely on appearance similarity to detect novel objects and are also prone to overfitting short-cut cues such as textures and discriminative parts. To address these shortcomings of RGB-based object detectors, we propose incorporating geometric cues such as depth and normals, predicted by general-purpose monocular estimators. Specifically, we use the geometric cues to train an object proposal network for pseudo-labeling unannotated novel objects in the training set. Our resulting Geometry-guided Open-world Object Detector (GOOD) significantly improves detection recall for novel object categories and already performs well with only a few training classes. Using a single "person" class for training on the COCO dataset, GOOD surpasses SOTA methods by 5.0% AR@100, a relative improvement of 24%.

研究动机与目标

  • 解决开放世界无类别感知目标检测的挑战,即模型需检测场景中所有物体,尽管仅在少数基础类别上进行训练。
  • 克服基于 RGB 的检测器因过度拟合训练类别而难以泛化至外观新颖的物体的局限。
  • 利用预训练单目估计器提供的几何线索(深度与法线)提升对未见类别物体的检测召回率。
  • 降低对基于外观的线索的依赖,避免在少样本开放世界设置下因纹理和判别性部件导致的捷径学习。

提出的方法

  • 使用现成的单目深度与法线估计器,从 RGB 图像中预测几何线索,无需微调。
  • 在预测的几何图上训练目标提议网络,以识别训练集中未标注的新型物体。
  • 从基于几何的提议网络的最高预测结果中生成伪边界框,用于最终 RGB 检测器的训练。
  • 通过伪标签中的新型物体对 RGB 检测器进行微调,以提升对未见类别的泛化能力。
  • 在检测器训练过程中应用 AutoAugment 数据增强,以缓解伪标签中的噪声并提升鲁棒性。
  • 采用两阶段训练流程:首先在几何线索上训练提议网络;其次在 RGB 输入上使用生成的伪标签训练检测器。

实验结果

研究问题

  • RQ1深度与法线等几何线索是否能提升开放世界目标检测中对新型物体类别的检测召回率?
  • RQ2引入几何线索是否能减少对基础类别的过拟合,并提升对未见物体类别的泛化能力?
  • RQ3在少样本开放世界检测中,基于几何线索的伪标签方法相较于纯 RGB 方法的性能如何?
  • RQ4几何线索在提升新型物体检测性能方面,相较于数据增强与形状偏置,优势有多大?
  • RQ5基础类别的数量如何影响 GOOD 与最先进方法在开放世界检测中的性能差距?

主要发现

  • 在 COCO 上仅使用一个基础类别('person')进行训练时,GOOD 相比最先进方法实现了 5.0% 的 AR@100 绝对提升,相对提升达 24%。
  • 仅使用一个基础类别时,GOOD 在 ADE20K 验证集上检测到 18 个真正例,优于 OLN(13 个)与 GGN(14 个),表明其对新型类别的泛化能力更强。
  • 基于几何线索训练的物体提议网络能生成高质量的前 K 个预测(AR N @k ≤ 5),表明深度与法线图对识别新型物体具有显著有效性。
  • 结合伪标签使用 AutoAugment 数据增强可提升对新型类别的性能,但若仅应用于真实标注数据则无法改善泛化能力。
  • GOOD 仅需一半的基础类别数量(如 39 vs. 80)即可达到与 OLN 相当的性能,表明其具有更高的样本效率并减少了过拟合。
  • 该方法显著缩小了基础类别与新型类别之间的 AR 差距,表明几何线索有助于弥合不同物体类别间的泛化鸿沟。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。