Skip to main content
QUICK REVIEW

[论文解读] Move to See Better: Self-Improving Embodied Object Detection

Zhaoyuan Fang, Ayush Jain|arXiv (Cornell University)|Nov 30, 2020
Advanced Neural Network Applications参考文献 54被引用 13
一句话总结

本文提出一种自监督方法,使具身智能体通过主动移动收集多视角RGB-D数据,利用视角聚合生成高质量的2D和3D伪标签,并在无需人工标注的情况下微调预训练检测器,从而提升2D和3D目标检测性能。该方法在新环境中的检测器性能显著提升,优于先前的自监督3D检测方法,同时实现了对新物体类别的弱监督学习。

ABSTRACT

Passive methods for object detection and segmentation treat images of the same scene as individual samples and do not exploit object permanence across multiple views. Generalization to novel or difficult viewpoints thus requires additional training with lots of annotations. In contrast, humans often recognize objects by simply moving around, to get more informative viewpoints. In this paper, we propose a method for improving object detection in testing environments, assuming nothing but an embodied agent with a pre-trained 2D object detector. Our agent collects multi-view data, generates 2D and 3D pseudo-labels, and fine-tunes its detector in a self-supervised manner. Experiments on both indoor and outdoor datasets show that (1) our method obtains high-quality 2D and 3D pseudo-labels from multi-view RGB-D data; (2) fine-tuning with these pseudo-labels improves the 2D detector significantly in the test environment; (3) training a 3D detector with our pseudo-labels outperforms a prior self-supervised method by a large margin; (4) given weak supervision, our method can generate better pseudo-labels for novel objects.

研究动机与目标

  • 使具身智能体在真实测试环境中无需人工标注数据即可提升目标检测性能。
  • 利用自监督学习从多视角RGB-D观测中生成高质量的2D和3D伪标签。
  • 证明主动移动与视角聚合可超越静态数据采集,提升检测性能。
  • 仅通过单张标注视图实现对新物体类别的弱监督学习。
  • 在性能上超越现有自监督3D检测方法,同时接近全监督基线模型的表现。

提出的方法

  • 智能体通过随机探索收集RGB-D数据,并规划路径前往检测到的物体的多样化视角。
  • 在聚合的RGB-D数据上执行3D实例分割,并将3D掩码重新投影以生成所有视角下的2D伪标签。
  • 以自监督方式使用生成的伪标签对预训练的2D检测器进行微调。
  • 对于弱监督设置,仅对每个物体提供一张视图的2D真实标注,通过跨视角传播以提升标签质量。
  • 该方法利用物体恒常性与视角一致性,将置信度高的检测结果跨视角传播。
  • 利用近似自运动估计对齐多视角观测,提升3D重建与分割的准确性。

实验结果

研究问题

  • RQ1具身智能体能否仅依靠预训练检测器、深度传感器和自监督学习,在测试环境中提升其2D目标检测性能?
  • RQ2能否在无需人工标注的情况下,利用多视角RGB-D数据生成高质量的2D和3D伪标签?
  • RQ3所提出的自监督3D检测方法是否优于现有的自监督3D检测基线方法?
  • RQ4当提供弱监督(如单张标注视图)时,该方法能否为新物体类别生成更优的伪标签?
  • RQ5该方法在真实环境中面对实际执行噪声和具有挑战性的视角时,表现有多稳健?

主要发现

  • 该方法从多视角RGB-D数据中生成了高质量的2D和3D伪标签,显著提升了室内和室外数据集上2D检测器的性能。
  • 使用生成的伪标签对2D检测器进行微调,在无需额外标注的情况下显著提升了测试环境中的检测性能。
  • 在CARLA测试集上,基于SbM生成的伪标签训练的自监督3D检测器,mAP@0.25达到39.84,优于当前最先进方法LDLS。
  • 基于SbM伪标签训练的3D检测器在mAP@0.25上达到83.87,与全监督模型(85.06 mAP@0.25)仅相差1.19分。
  • 在弱监督设置下(每类物体仅提供一张标注视图),基于SbM-ws伪标签训练的检测器优于在相同有限真实标注数据上微调的检测器,证明了有效的数据增强能力。
  • 该方法仅通过单张标注视图,成功学习了非COCO类别(如Cushion、Nightstand)的检测器,展现出对未见物体类别的强大泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。