Skip to main content
QUICK REVIEW

[论文解读] An Analysis of Deep Object Detectors For Diver Detection

Karin de Langis, Michael Fulton|arXiv (Cornell University)|Nov 25, 2020
Advanced Neural Network Applications参考文献 39被引用 11
一句话总结

本文介绍了视频潜水面具检测数据集(VDD-100K),这是一个大规模、基于视频的105,000张标注潜水面具图像数据集,并评估了多种深度学习目标检测器(包括SSD、YOLOv4和LSTM-SSD)在水下机器人中实时潜水面具检测的性能。研究发现,Tiny-YOLOv4和SSD模型在实时AUV应用中实现了速度、精度和时间稳定性的最佳平衡,基于视频的模型在提升检测一致性方面展现出良好前景。

ABSTRACT

With the end goal of selecting and using diver detection models to support human-robot collaboration capabilities such as diver following, we thoroughly analyze a large set of deep neural networks for diver detection. We begin by producing a dataset of approximately 105,000 annotated images of divers sourced from videos -- one of the largest and most varied diver detection datasets ever created. Using this dataset, we train a variety of state-of-the-art deep neural networks for object detection, including SSD with Mobilenet, Faster R-CNN, and YOLO. Along with these single-frame detectors, we also train networks designed for detection of objects in a video stream, using temporal information as well as single-frame image information. We evaluate these networks on typical accuracy and efficiency metrics, as well as on the temporal stability of their detections. Finally, we analyze the failures of these detectors, pointing out the most common scenarios of failure. Based on our results, we recommend SSDs or Tiny-YOLOv4 for real-time applications on robots and recommend further investigation of video object detection methods.

研究动机与目标

  • 为解决水下机器人中潜水面具检测缺乏大规模、基于视频的数据集的问题。
  • 评估最先进深度学习目标检测器在真实机器人部署环境中的性能、稳定性和效率。
  • 识别潜水面具检测系统中的故障模式,特别是与部分可见性和遮挡相关的问题。
  • 为水下环境中实时人机协作选择最优模型提供指导。
  • 探索基于视频的目标检测在提升潜水面具跟踪时间稳定性方面的潜力。

提出的方法

  • 通过从游泳池和实地环境收集并完全标注约105,000帧视频图像,构建了VDD-100K数据集,涵盖多样的潜水面具姿态、光照条件和运动状态。
  • 训练了多种深度学习模型,包括单帧检测器(SSD与MobileNetv2/v3、YOLOv4、YOLOv4-tiny、Faster R-CNN)和一种利用时间上下文的基于视频的检测器(LSTM-SSD)。
  • 使用标准目标检测指标(精确率、召回率、mAP在IOU阈值0.5、0.75和0.5–0.95下)评估模型,并引入时间稳定性指标:平移误差、缩放误差和碎片化误差。
  • 在GPU和嵌入式Jetson TX2平台上测量推理速度,以评估其在AUV部署中的实时可行性。
  • 通过分析假阴性案例,识别出部分图像包含和相互遮挡是主要故障原因。
  • 采用置信度阈值优化方法,在所有模型间实现精度与召回率的公平比较。

实验结果

研究问题

  • RQ1在大规模水下潜水面具检测数据集上,最先进单帧检测器与基于视频的检测器在准确性、稳定性及推理速度方面的表现如何?
  • RQ2在真实水下视频流中,基于深度学习的潜水面具检测器最常见的故障场景是什么?
  • RQ3在目标检测中引入时间上下文是否能相比单帧模型提升检测稳定性?
  • RQ4哪些模型在嵌入式机器人平台部署中实现了实时推理性能与检测精度的最佳平衡?
  • RQ5与静态图像数据集相比,基于视频的数据集在多大程度上能提升模型的泛化能力与对运动及视角变化的鲁棒性?

主要发现

  • 在Jetson TX2上,YOLOv4-Tiny实现了35 FPS的最高推理速度,优于其他模型,展现出在实时嵌入式部署场景中的优势。
  • LSTM-SSD相比标准SSD变体表现出更低的碎片化误差,表明其时间一致性更优,尽管推理时间更长。
  • YOLOv4和YOLOv4-Tiny在所有模型中表现出最低的碎片化误差,表明其在边界框跟踪中具有更优的时间稳定性。
  • 最常见的故障模式是潜水面具未完全出现在画面中(边缘情况)以及被其他潜水面具遮挡,占假阴性结果的显著比例。
  • SSD与MobileNetv3-Large以及SSD与MobileNetv2在保持高精度的同时具备合理的推理速度,适用于对检测一致性有更高要求而对速度要求不高的应用。
  • 尽管mAP较低,LSTM-SSD在碎片化误差低和推理速度快方面表现出强潜力,表明应进一步探索基于视频的检测方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。