Skip to main content
QUICK REVIEW

[论文解读] Small Object Detection for Near Real-Time Egocentric Perception in a Manual Assembly Scenario

Hooman Tavakoli, Snehal Walunj|arXiv (Cornell University)|Jun 11, 2021
Industrial Vision Systems and Defect Detection参考文献 17被引用 6
一句话总结

本文提出了一种用于近实时自传式感知中微小目标检测的两阶段检测流程,利用CAD生成的合成数据和上下文感知能力。通过先检测背景板(上下文),再裁剪并重新检测微小按钮,该方法在IoU=0.10时实现了70%的mAP,显著优于单阶段检测方法。

ABSTRACT

Detecting small objects in video streams of head-worn augmented reality devices in near real-time is a huge challenge: training data is typically scarce, the input video stream can be of limited quality, and small objects are notoriously hard to detect. In industrial scenarios, however, it is often possible to leverage contextual knowledge for the detection of small objects. Furthermore, CAD data of objects are typically available and can be used to generate synthetic training data. We describe a near real-time small object detection pipeline for egocentric perception in a manual assembly scenario: We generate a training data set based on CAD data and realistic backgrounds in Unity. We then train a YOLOv4 model for a two-stage detection process: First, the context is recognized, then the small object of interest is detected. We evaluate our pipeline on the augmented reality device Microsoft Hololens 2.

研究动机与目标

  • 解决在头戴式AR设备的低分辨率自传式视频流中检测微小目标的挑战。
  • 通过从CAD模型生成高质量的合成数据,克服微小目标真实世界训练数据有限的问题。
  • 通过利用上下文知识——先检测目标的上下文(如底板),再聚焦于微小目标(如按钮)——提升检测准确率。
  • 实现在边缘设备上近实时推理(9.4 fps),以部署于Microsoft HoloLens 2。
  • 评估层级检测在减少误报和提升微小目标mAP方面的有效性。

提出的方法

  • 使用Unity 3D通过从多个视角、在不同光照和背景条件下渲染小物体(如按钮)的CAD模型,生成合成训练数据。
  • 通过将合成物体渲染与真实背景图像结合,应用领域随机化以提升泛化能力。
  • 实施两阶段YOLOv4检测流程:首先检测上下文(底板),然后在裁剪区域中重新检测微小物体(按钮)。
  • 第一阶段模型检测底板;第二阶段模型在裁剪区域上微调,以更高分辨率和上下文感知特征检测微小按钮。
  • 训练采用YOLOv4.conv.137的迁移学习,结合数据增强(旋转、剪切),并在真实数据实验中训练2000个周期。
  • 在配备RTX 2080的笔记本电脑上进行边缘推理,实时处理Hololens 2摄像头的视频流。

实验结果

研究问题

  • RQ1从CAD模型生成的合成数据是否能显著提升自传式AR场景中微小目标的检测性能?
  • RQ2两阶段检测流程——先检测上下文,再聚焦于微小目标——是否相比单阶段检测能提升mAP?
  • RQ3上下文感知是否能减少误报,并提升在光照和遮挡情况多变的真实世界测试数据上的泛化能力?
  • RQ4该两阶段流程是否足够高效,可实现在Hololens 2输入下边缘设备的近实时部署?
  • RQ5与真实背景结合的领域随机化在多大程度上提升了合成训练数据的泛化能力?

主要发现

  • 仅在真实图像上训练的单阶段模型在IoU=0.10时mAP仅为2.6%,表明由于训练数据有限,泛化能力差。
  • 在更大规模的合成数据集(3,800张图像)上进行训练,将按钮检测的mAP提升至IoU=0.10时的44%,显示出合成数据的优势。
  • 两阶段流程在IoU=0.10时实现70%的mAP,显著优于单阶段方法。
  • 通过利用上下文,两阶段方法减少了误检,表现为在裁剪区域上的mAP高于全图检测。
  • 该流程在边缘设备上实现了9.4 fps,满足工业AR应用中近实时性能的阈值要求。
  • CAD生成的合成数据、领域随机化和层级检测的结合,被证明是实现自传式场景中鲁棒微小目标检测的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。