[论文解读] The Fishnet Open Images Database: A Dataset for Fish Detection and Fine-Grained Categorization in Fisheries
Fishnet Open Images 数据集是一个大规模、公开可用的数据集,包含来自商业长线金枪鱼渔船电子监控系统的 86,029 幅图像,涵盖 34 种鱼类,并带有用于目标检测和细粒度分类的标注边界框。该数据集面临诸多挑战,包括长尾类分布、物种间视觉相似性以及恶劣的环境条件,可作为推动渔业监控计算机视觉研究的基准。目前最先进的模型在检测和分类任务上的表现中等。
Camera-based electronic monitoring (EM) systems are increasingly being deployed onboard commercial fishing vessels to collect essential data for fisheries management and regulation. These systems generate large quantities of video data which must be reviewed on land by human experts. Computer vision can assist this process by automatically detecting and classifying fish species, however the lack of existing public data in this domain has hindered progress. To address this, we present the Fishnet Open Images Database, a large dataset of EM imagery for fish detection and fine-grained categorization onboard commercial fishing vessels. The dataset consists of 86,029 images containing 34 object classes, making it the largest and most diverse public dataset of fisheries EM imagery to-date. It includes many of the characteristic challenges of EM data: visual similarity between species, skewed class distributions, harsh weather conditions, and chaotic crew activity. We evaluate the performance of existing detection and classification algorithms and demonstrate that the dataset can serve as a challenging benchmark for development of computer vision algorithms in fisheries. The dataset is available at https://www.fishnet.ai/.
研究动机与目标
- 为解决商业渔业中鱼类检测与分类缺乏公开可用的大规模电子监控(EM)图像的问题。
- 创建一个基准数据集,以捕捉真实世界中的挑战,如物种间的视觉相似性、长尾类分布以及低能见度条件。
- 推动在渔业场景下细粒度视觉分类、域自适应和目标检测的研究,尤其是在具有挑战性的环境与操作条件下。
- 支持对 EM 视频数据的可扩展、自动化分析,以减少对人工审核的依赖,并提升渔业管理效率。
提出的方法
- 数据集来自西太平洋和中太平洋长线金枪鱼渔船上的 73 个电子监控摄像头,通过时间戳提取视频片段,并附有物种级别的标注。
- 图像以每秒一帧的频率采样,边界框由专业标注员通过公司(Sama)进行标注,并对多鱼图像进行人工复核,以纠正基于图像级别的标签所导致的错误。
- 数据集经过清理,排除了个人身份信息,包括对人脸进行模糊处理,并排除了与船只相关的标识符。
- 数据集包含 86,029 幅图像,涵盖 34 个目标类别,共 406,463 个边界框,类别标签按层级结构(L1 和 L2)组织,以支持细粒度分类。
- 通过 YOLOv5 和 Faster R-CNN 模型进行目标检测基准测试,通过 Inception-V3 模型进行图像分类,评估在已见与未见摄像头以及金枪鱼与非金枪鱼子集上的表现。
- 分类训练期间采用数据增强技术,包括随机水平翻转、旋转、缩放以及光照/对比度调整。
实验结果
研究问题
- RQ1现有目标检测模型在具有长尾类分布和复杂视觉条件的大规模真实渔业 EM 数据集上的表现如何?
- RQ2领域偏移(特别是测试于此前未见过的摄像头)在渔业 EM 图像中对检测与分类性能的影响有多大?
- RQ3在渔业 EM 数据背景下,细粒度分类的难度与目标定位的难度相比如何?
- RQ4标签粒度(L1 与 L2)对检测与分类性能的影响如何,特别是对稀有物种与常见物种的影响?
- RQ5在新环境中,模型能否在该数据集上实现良好泛化?实现稳健的域自适应面临的主要挑战是什么?
主要发现
- 最先进的检测模型在 L1 标签集上的平均精度均值(mAP)为 0.355,在 L2 标签集上为 0.378,表明在物种间视觉相似性高的挑战性数据集上表现中等。
- 使用粗粒度标签(L2)训练的模型表现略优于使用细粒度标签(L1)的模型,表明标签粒度会影响模型泛化能力。
- 在未见过的摄像头上的性能显著下降,尤其在目标检测任务中,表明真实渔业 EM 数据中存在强烈的领域偏移效应。
- 分类模型在 L1 标签集上的 top-1 准确率为 81.2%,在 L2 标签集上为 82.1%,非金枪鱼物种的性能比金枪鱼物种低超过 7%,凸显了长尾分布带来的挑战。
- 在 1 类和 2 类标签集上训练的模型比在多类标签集上训练的模型在未见摄像头上的泛化能力更好,表明在域自适应中分类任务比定位任务更具挑战性。
- 该数据集表明,分类难度而非定位难度是检测性能的主要瓶颈,尤其是在领域偏移条件下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。