Skip to main content
QUICK REVIEW

[论文解读] A Guide to Image and Video based Small Object Detection using Deep Learning : Case Study of Maritime Surveillance

Aref Miri Rekavandi, Xu Lian|arXiv (Cornell University)|Jul 26, 2022
Advanced Neural Network Applications被引用 13
一句话总结

本文综述了2017至2022年间160余篇基于深度学习的小目标检测(SOD)研究,聚焦于海事监视中的图像与视频应用。提出了SOD技术的分类体系,评估了关键数据集与指标,并指出了未来研究方向,包括基于Transformer的模型、时空融合、轻量化架构,以及超分辨率与图像增强等方法的跨领域迁移。

ABSTRACT

Small object detection (SOD) in optical images and videos is a challenging problem that even state-of-the-art generic object detection methods fail to accurately localize and identify such objects. Typically, small objects appear in real-world due to large camera-object distance. Because small objects occupy only a small area in the input image (e.g., less than 10%), the information extracted from such a small area is not always rich enough to support decision making. Multidisciplinary strategies are being developed by researchers working at the interface of deep learning and computer vision to enhance the performance of SOD deep learning based methods. In this paper, we provide a comprehensive review of over 160 research papers published between 2017 and 2022 in order to survey this growing subject. This paper summarizes the existing literature and provide a taxonomy that illustrates the broad picture of current research. We investigate how to improve the performance of small object detection in maritime environments, where increasing performance is critical. By establishing a connection between generic and maritime SOD research, future directions have been identified. In addition, the popular datasets that have been used for SOD for generic and maritime applications are discussed, and also well-known evaluation metrics for the state-of-the-art methods on some of the datasets are provided.

研究动机与目标

  • 为解决在光学图像与视频中检测小目标的严峻挑战,特别是在目标遥远且占据图像面积不足10%的海事环境中。
  • 弥合通用小目标检测(SOD)研究与具有高实际应用价值但尚未充分探索的海事特定应用之间的差距。
  • 通过回顾50余个数据集、评估指标与性能基准,为通用与海事SOD建立标准化的基准测试框架。
  • 识别并推荐未来研究方向,以提升实时海事监视系统中的检测精度、效率与鲁棒性。

提出的方法

  • 对2017至2022年间发表的160余篇基于深度学习的SOD研究进行了系统性文献综述。
  • 构建了SOD技术的分类体系,按网络架构(2D-CNN、3D-CNN、RNN、Transformer)、特征学习(多尺度、上下文、特征聚合)与损失函数进行分类。
  • 回顾并对比了50余个SOD应用中的数据集,包括Tsinghua-Tencent 100K、CURE-TSD、DOTA、TinyPerson、ETRI-Maritime与SeaDronesSees,涵盖通用与海事应用场景。
  • 评估了mAP、IoU与F1-score等标准学习与评估指标,并讨论了其在SOD场景中的局限性。
  • 提出了视频中小目标的新定义:在时空范围内受限——空间上较小且仅出现在少数帧中——并将其扩展至3D-CNN框架,以支持2D-CNN方法的延伸。
  • 通过对比通用SOD中使用的技术(如超分辨率、上下文学习)与海事SOD中使用的技术(如图像增强、海陆分割),分析了跨领域迁移的潜力。

实验结果

研究问题

  • RQ1在不同数据集上,最先进的基于深度学习的小目标检测方法在海事环境与通用视觉环境中的表现如何?
  • RQ2在低分辨率与高遮挡场景下,哪些架构、特征工程与损失函数组件显著提升了SOD性能?
  • RQ3为何标准目标检测器在小目标上表现不佳?深度神经网络中的哪些特定设计选择会加剧此问题?
  • RQ4超分辨率、图像增强与海陆分割等技术在海事SOD与通用SOD之间可迁移的程度如何,反之亦然?
  • RQ5如何更有效地利用视频序列中的时间信息,以减少在能见度差或遮挡情况下的误报与漏检?

主要发现

  • 基于Transformer的模型在提升基于视频的小目标检测(VSOD)与海事SOD方面展现出强大潜力,在特征表示与长距离依赖建模方面优于传统CNN。
  • 当前SOD方法存在较高的计算复杂度,亟需开发适用于实时海事监视系统的轻量化、高精度模型。
  • 尽管具有减少误报与提升遮挡或低质量条件下检测鲁棒性的潜力,但仅有极少数SOD研究利用了视频中的时间信息。
  • 多任务与联合学习流程虽在全局特征提取方面有效,但在SOD中,尤其是在海事场景中,仍处于研究不足状态。
  • 3D-CNN可通过建模时空特征,将基于2D-CNN的SOD方法扩展至视频应用,而‘有限时空信息’的概念为视频中小目标提供了新的定义。
  • 广泛应用于海事SOD的超分辨率与图像增强技术尚未系统性应用于通用SOD,反之亦然,表明跨领域创新存在巨大未开发潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。