Skip to main content
QUICK REVIEW

[论文解读] Assessing fish abundance from underwater video using deep neural networks

Ranju Mandal, Rod M. Connolly|arXiv (Cornell University)|Jul 16, 2018
Water Quality Monitoring Technologies参考文献 7被引用 10
一句话总结

本文提出了一种基于Faster R-CNN的端到端深度学习系统,结合来自三个预训练分类网络(VGG-16、ResNet-50、Inception-V3)的迁移学习,以自动检测和分类水下视频流中的鱼类物种。该方法在新整理的来自昆士兰州东南部的50种鱼类和甲壳类物种的数据集上实现了82.4%的平均精度均值(mAP),显著优于先前的最先进方法。

ABSTRACT

Uses of underwater videos to assess diversity and abundance of fish are being rapidly adopted by marine biologists. Manual processing of videos for quantification by human analysts is time and labour intensive. Automatic processing of videos can be employed to achieve the objectives in a cost and time-efficient way. The aim is to build an accurate and reliable fish detection and recognition system, which is important for an autonomous robotic platform. However, there are many challenges involved in this task (e.g. complex background, deformation, low resolution and light propagation). Recent advancement in the deep neural network has led to the development of object detection and recognition in real time scenarios. An end-to-end deep learning-based architecture is introduced which outperformed the state of the art methods and first of its kind on fish assessment task. A Region Proposal Network (RPN) introduced by an object detector termed as Faster R-CNN was combined with three classification networks for detection and recognition of fish species obtained from Remote Underwater Video Stations (RUVS). An accuracy of 82.4% (mAP) obtained from the experiments are much higher than previously proposed methods.

研究动机与目标

  • 自动化从水下视频画面中手动评估鱼类丰度的繁琐过程。
  • 解决水下目标检测中的挑战,如遮挡、光照变化、复杂背景以及尺度和姿态变化。
  • 开发一种稳健的端到端系统,能够在非受限环境中实现实时检测与识别多种海洋物种。
  • 创建并发布一个标准化的、公开可用的数据集,包含50种鱼类和甲壳类物种,并以PASCAL VOC格式标注。
  • 在准确性和可扩展性方面超越现有的半自动和基于手工特征的方法,用于鱼类丰度监测。

提出的方法

  • 采用端到端的Faster R-CNN架构,结合区域提议网络(RPN)与三种不同的主干分类网络(VGG-16、ResNet-50、Inception-V3)。
  • 通过在自定义水下鱼类数据集上微调预训练分类网络,应用迁移学习以提升特征提取能力。
  • 系统处理视频帧,生成目标边界框,并将每个检测区域分类到预定义的物种类别中。
  • 从澳大利亚昆士兰州东南部多个海滩和河口区域收集了包含50种海洋物种的自定义数据集,并使用Vatic视频标注工具进行标注。
  • 模型训练与评估使用平均精度均值(mAP)作为主要指标,性能在90,000次迭代过程中持续跟踪。
  • 对误报和漏报进行了误差分析,识别出遮挡和背景纹理相似性为主要的失败模式。

实验结果

研究问题

  • RQ1基于深度学习的系统是否能在非受限水下视频流中实现高精度的鱼类物种检测与分类?
  • RQ2在水下鱼类检测与分类背景下,不同主干网络(VGG-16、ResNet-50、Inception-V3)的性能表现如何比较?
  • RQ3从预训练模型进行迁移学习在有限的、领域特定的水下鱼类数据集上,能在多大程度上提升检测精度?
  • RQ4在真实水下条件下,自动鱼类检测的主要失败模式是什么,如何加以缓解?
  • RQ5全自动化系统是否能在准确性和可扩展性方面超越现有的半自动或基于手工特征的方法?

主要发现

  • 所提出的系统在测试数据集上实现了82.4%的平均精度均值(mAP),显著优于先前方法,包括Spampinato等人在更小的10个物种数据集上实现的54%。
  • VGG-16在70,000次迭代时达到最高的mAP(0.72),而最终模型在所有三个网络上经过90,000次迭代后达到82.4%的mAP。
  • 该系统成功在复杂水下环境中检测并分类了多方向、多尺度的鱼类物种,背景杂乱程度高。
  • 漏报主要由成群鱼类的严重遮挡引起,而误报则源于与鱼的图案相似的背景纹理。
  • 以PASCAL VOC格式标注的50个物种数据集已公开可用,为未来水下物种监测研究做出了重要贡献。
  • 端到端的深度学习流水线实现了实时、自动的鱼类丰度评估,减少了对专家人力和人工视频分析的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。