Skip to main content
QUICK REVIEW

[论文解读] FathomNet: An underwater image training database for ocean exploration and discovery

Océane Boulais, Ben Woodward|arXiv (Cornell University)|Jun 30, 2020
Underwater Vehicles and Communication Systems参考文献 12被引用 13
一句话总结

FathomNet 提出了一套大规模、专家标注的水下图像数据库,包含超过 80,000 幅图像和 106,000 个定位,覆盖 233 个类别,旨在加速深度学习在自动化海洋探索中的应用。该数据库支持目标检测、分类和弱监督定位,尽管仍需更大规模的数据以提升泛化能力和分布外鲁棒性,但已展现出令人鼓舞的结果。

ABSTRACT

Thousands of hours of marine video data are collected annually from remotely operated vehicles (ROVs) and other underwater assets. However, current manual methods of analysis impede the full utilization of collected data for real time algorithms for ROV and large biodiversity analyses. FathomNet is a novel baseline image training set, optimized to accelerate development of modern, intelligent, and automated analysis of underwater imagery. Our seed data set consists of an expertly annotated and continuously maintained database with more than 26,000 hours of videotape, 6.8 million annotations, and 4,349 terms in the knowledge base. FathomNet leverages this data set by providing imagery, localizations, and class labels of underwater concepts in order to enable machine learning algorithm development. To date, there are more than 80,000 images and 106,000 localizations for 233 different classes, including midwater and benthic organisms. Our experiments consisted of training various deep learning algorithms with approaches to address weakly supervised localization, image labeling, object detection and classification which prove to be promising. While we find quality results on prediction for this new dataset, our results indicate that we are ultimately in need of a larger data set for ocean exploration.

研究动机与目标

  • 为解决因人工视频审阅导致的海洋数据分析瓶颈,创建一个可扩展的、专家标注的水下图像训练数据集。
  • 加速开发用于水下环境中实时目标检测、分类和定位的深度学习模型。
  • 通过提供一个标准化、持续维护的数据集并附带丰富的语义标注,实现对载人潜水器和无人潜水器视频数据的自动化分析。
  • 支持分层和多标签标注工作流,以提升生物多样性分析中的可扩展性和准确性。
  • 通过开放数据共享和低成本技术整合,使全球代表性不足的社区也能平等获取海洋学数据和工具。

提出的方法

  • 该数据集基于超过 26,000 小时的载人潜水器视频构建,利用 VARS 系统提取并标注帧图像,附带图像级别标签和边界框。
  • 根据标注频率,选取了前 18 个中层水域和 17 个底栖生物的属,以及 3 个地质特征,作为 FathomNet 的核心类别。
  • 采用弱监督定位技术生成初始边界框提案,随后由专家手动验证并修正,以提高标注效率。
  • 使用标准的基于卷积神经网络的架构训练深度学习模型,重点提升在数据分布偏移和尺度变化下的泛化能力。
  • 开发了分层标注策略,支持多阶段模型:从粗粒度的分类层级开始,利用少样本学习逐步细化至更精确的分类。
  • 探索了分割掩码和多标签标注作为未来扩展,以支持实例分割和语义分割任务。

实验结果

研究问题

  • RQ1大规模、专家标注的水下图像数据集是否能显著加速自动化目标检测与分类模型的开发?
  • RQ2弱监督定位技术在保持海洋物种检测精度的同时,能否有效减少标注时间?
  • RQ3当前数据集在面对数据分布偏移(如尺度、视角或背景变化)时,其泛化能力如何,特别是在真实载人潜水器部署中的表现?
  • RQ4分层标注与少样本学习方法在提升稀有或新发现海洋物种分类标注可扩展性方面,其潜力有多大?
  • RQ5发布高分辨率海洋图像和元数据对海洋保护有何影响?如何防范潜在的滥用行为?

主要发现

  • FathomNet 包含超过 80,000 幅图像和 106,000 个定位,覆盖 233 个不同类别,包括中层水域和底栖生物,其底层 VARS 知识库中包含超过 680 万个标注。
  • 深度学习模型的实验表明,在目标检测、分类和弱监督定位方面均表现出令人鼓舞的性能,验证了该数据集作为基线的实用性。
  • 尽管初始结果强劲,但研究发现当前数据量仍不足以完全解决分布偏移和分布外泛化问题,凸显了对更大规模数据的需求。
  • 分层标注与少样本学习的结合在加速新分类层级标注方面展现出潜力,尤其适用于稀有或新发现的物种。
  • 分割和多标签标注工作流被确定为关键的下一步,但这些任务的数据收集仍是重大瓶颈。
  • 本项目强调了元数据管理的重要性,以防止非法捕捞等滥用行为,同时促进海洋研究的开放获取与全球公平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。