Skip to main content
QUICK REVIEW

[论文解读] Deep Learning Innovations for Underwater Waste Detection: An In-Depth Analysis

Jaskaran Singh Walia, L K Pavithra|arXiv (Cornell University)|May 28, 2024
Water Quality Monitoring TechnologiesEnvironmental Science被引用 3
一句话总结

本文评估了最先进的深度学习模型,特别是 YOLOv8 变体,在多种水生环境中的实时水下垃圾检测性能。通过使用精心筛选的数据集,并与多种架构进行基准测试,结果表明 YOLOv8-nano 和 YOLOv8-XLarge 在准确率和实时推理速度方面表现优异,使其成为在自主水下航行器(AUVs)上部署用于海洋垃圾检测与清除系统的理想选择。

ABSTRACT

Addressing the issue of submerged underwater trash is crucial for safeguarding aquatic ecosystems and preserving marine life. While identifying debris present on the surface of water bodies is straightforward, assessing the underwater submerged waste is a challenge due to the image distortions caused by factors such as light refraction, absorption, suspended particles, color shifts, and occlusion. This paper conducts a comprehensive review of state-of-the-art architectures and on the existing datasets to establish a baseline for submerged waste and trash detection. The primary goal remains to establish the benchmark of the object localization techniques to be leveraged by advanced underwater sensors and autonomous underwater vehicles. The ultimate objective is to explore the underwater environment, to identify, and remove underwater debris. The absence of benchmarks (dataset or algorithm) in many researches emphasizes the need for a more robust algorithmic solution. Through this research, we aim to give performance comparative analysis of various underwater trash detection algorithms.

研究动机与目标

  • 建立基于深度学习目标检测模型的水下垃圾检测性能基准。
  • 评估在自主水下航行器(AUVs)上部署轻量化、实时推理模型以实现垃圾定位的可行性。
  • 解决水下废物检测研究中缺乏通用性与鲁棒性数据集及算法的问题。
  • 比较现代深度学习架构(包括 YOLO 变体和 Mask R-CNN)在具有复杂失真的水下图像数据上的性能表现。
  • 为水下目标检测与自主垃圾清除领域的未来研究提供标准化基线。

提出的方法

  • 精心筛选并调整数据集,以涵盖包括透光层和中层水域在内的多种水下环境,确保模型的泛化能力。
  • 在调整后的数据集上训练并评估多种深度学习目标检测模型,包括 YOLOv5、YOLOv7、YOLOv8、YOLO-NAS 和 YOLO-SAM。
  • 采用标准目标检测指标(如精确率、召回率、F1 分数和损失)对模型性能进行定量比较。
  • 使用公式:$ImgCord_{k} = BoxScore_{i}^{j} \times Width$ 将归一化的模型输出坐标转换为像素坐标,以实现边界框可视化。
  • 在未见过的视频数据上进行实时推理测试,包括一段广为传播的巴厘岛海洋垃圾视频,以评估模型在新型视觉情境下的鲁棒性。
  • 使用混淆矩阵和批量检测对比分析,验证检测的可靠性与模型的一致性。

实验结果

研究问题

  • RQ1哪些深度学习目标检测模型在水下垃圾检测中实现了最高的实时推理速度与准确率?
  • RQ2轻量化 YOLO 变体与 Faster R-CNN 和 Mask R-CNN 等重型模型相比,在性能与计算效率方面表现如何?
  • RQ3所提出的模型能否泛化到具有复杂视觉失真的未见过的真实世界水下视频数据?
  • RQ4YOLOv8 模型在不同水下水层与环境条件下的表现如何?
  • RQ5模型预测在受控测试集与实时部署场景之间的一致性程度如何?

主要发现

  • YOLOv8-nano 和 YOLOv8-XLarge 在所有测试模型中取得了最高的 F1 分数,表明其在精确率与召回率之间实现了更优平衡。
  • YOLOv8-nano 和 YOLOv8-XLarge 均表现出适合部署于 AUV 的实时推理速度,满足近实时运行要求。
  • 轻量化 YOLO 模型在速度与 F1 分数方面均优于传统模型(如 Faster R-CNN 和 Mask R-CNN),证实其适用于资源受限的机器人平台。
  • 模型在未见过的测试数据(包括一段具有挑战性的巴厘岛病毒视频)上保持了稳定的性能,仅与受控评估结果存在轻微偏差。
  • 表现最佳的 YOLO 模型的混淆矩阵显示出高检测置信度与低误报率,表明其定位结果可靠。
  • YOLOv5s、v7、v8n 和 v8x 的损失曲线表明训练过程稳定收敛,支持 YOLOv8 系列在该领域中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。