[论文解读] NDD20: A large-scale few-shot dolphin dataset for coarse and fine-grained categorisation
NDD20 是一个大规模、开源的数据集,包含 2,201 幅水面以上和 1,050 幅水面以下的海豚图像,均标注了粗粒度和细粒度的实例分割信息,包含个体级别ID和物种标签。在该数据集上进行训练的 Mask-RCNN 模型,分别在水面以上和水面以下数据上实现了 mAP@IOU[0.5, 0.75] 为 0.96 和 0.97 的性能,为保护应用中海豚照片自动识别建立了强有力的基线。
We introduce the Northumberland Dolphin Dataset 2020 (NDD20), a challenging image dataset annotated for both coarse and fine-grained instance segmentation and categorisation. This dataset, the first release of the NDD, was created in response to the rapid expansion of computer vision into conservation research and the production of field-deployable systems suited to extreme environmental conditions -- an area with few open source datasets. NDD20 contains a large collection of above and below water images of two different dolphin species for traditional coarse and fine-grained segmentation. All data contained in NDD20 was obtained via manual collection in the North Sea around the Northumberland coastline, UK. We present experimentation using standard deep learning network architecture trained using NDD20 and report baselines results.
研究动机与目标
- 为解决保护领域海豚计算机视觉中缺乏开放、大规模且细粒度的数据集的问题。
- 实现在不同环境条件(水面以上与水面以下)下对自动照片识别系统进行基准测试。
- 支持基于独特标记识别个体海豚的少样本学习模型的开发。
- 减少齿鲸研究中对人工、耗时的照片识别的依赖。
- 为生态计算机视觉中的深度学习模型训练与评估提供标准化、公开可用的数据集。
提出的方法
- 通过在英国北海地区开展的 36 次水下调查和 27 次水面以上调查收集数据,使用单反相机和 GoPro 相机,在天气和水文条件有利的情况下进行拍摄。
- 所有图像均使用 VIA 2.0.8 格式进行人工标注,生成实例分割掩码,并设置分层标签:对象(海豚)、物种(BND, WBD)和个体ID。
- 通过伪匿名化处理,将真实ID替换为随机编号,并移除所有 EXIF 元数据,以保护正在进行的研究。
- 采用在 MSCOCO 上预训练的 ResNet-50 主干网络,使用余弦退火学习率调度策略,训练了两组 Mask-RCNN 模型。
- 在水面以上和水面以下子集上,分别采用 80:20 的训练-测试划分对模型进行评估,使用 mAP@IOU[0.5, 0.75] 作为评价指标。
- 数据集中为水面以下图像设置了“模糊”标志,以反映现实世界中的图像质量挑战。
实验结果
研究问题
- RQ1深度学习模型是否能在自然海洋环境中,对水面以上和水面以下的海豚图像实现高精度的实例分割?
- RQ2图像质量与环境条件(如水体能见度、折射效应)如何影响水下与水面以上场景下模型的性能?
- RQ3个体ID类别具有少样本特性在多大程度上影响模型的泛化能力与性能表现?
- RQ4该数据集能否支持对物种与个体识别任务的细粒度分类模型进行基准测试?
- RQ5海豚姿态变化与部分可见性差异在不同数据模态中如何影响分割精度?
主要发现
- 在水面以上图像上训练的 Mask-RCNN 模型实现了 mAP@IOU[0.5, 0.75] 为 0.96,表明尽管数据集存在视觉挑战,模型仍表现出色。
- 在水面以下图像上训练的模型 mAP@IOU[0.5, 0.75] 略高,达到 0.97,表明水下数据在掩码质量或特征可见性方面可能更具一致性。
- 水面以下数据 mAP 更高的原因可能是其身体朝向更一致,或水下环境中纹理特征更丰富,尽管环境噪声更大。
- 数据集中的个体ID呈现长尾分布,部分ID仅出现一次或两次,形成了真实的少样本学习挑战。
- 水面以下子集中存在“模糊”标志,证实图像质量是影响模型可靠性的关键因素。
- 研究结果为未来在细粒度海豚识别任务(包括物种和个体分类)中的研究建立了强有力的基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。