Skip to main content
QUICK REVIEW

[论文解读] Cattle Detection Occlusion Problem

Aparna Mendu, Bhavya Sehgal|arXiv (Cornell University)|Dec 21, 2022
Food Supply Chain Traceability被引用 4
一句话总结

本文提出 YOLOv7 作为检测无人机拍摄的 RGB 和热成像中被遮挡及小型牛只的最有效深度学习模型,优于使用 ResNet50 和 EfficientNet 主干网络的 RetinaNet 以及 Mask R-CNN。通过采用图像拼接(2x1 和 3x3)提升小目标检测性能,YOLOv7 实现了 61.2% 的最高精确率,展现出在复杂遮挡场景下的卓越性能。

ABSTRACT

The management of cattle over a huge area is still a challenging problem in the farming sector. With evolution in technology, Unmanned aerial vehicles (UAVs) with consumer level digital cameras are becoming a popular alternative to manual animal censuses for livestock estimation since they are less risky and expensive.This paper evaluated and compared the cutting-edge object detection algorithms, YOLOv7,RetinaNet with ResNet50 backbone, RetinaNet with EfficientNet and mask RCNN. It aims to improve the occlusion problem that is to detect hidden cattle from a huge dataset captured by drones using deep learning algorithms for accurate cattle detection. Experimental results showed YOLOv7 was superior with precision of 0.612 when compared to the other two algorithms. The proposed method proved superior to the usual competing algorithms for cow face detection, especially in very difficult cases.

研究动机与目标

  • 解决在大规模无人机牲畜监测中持续存在的遮挡及小型牛只检测挑战。
  • 评估并比较最先进的目标检测模型——YOLOv7、RetinaNet(采用 ResNet50 和 EfficientNet 主干网络)以及 Mask R-CNN 在遮挡条件下的牛只检测性能。
  • 通过图像拼接技术(2x1 和 3x3)提升隐藏或部分可见牛只的检测准确率,以增强分辨率与特征学习能力。
  • 展示 YOLOv7 的扩展 ELAN(E-ELAN)结构与从粗到细的标签分配机制在处理类别不平衡问题及提升复杂空中场景检测性能方面的有效性。
  • 为真实世界无人机数据集中的牛只检测建立基准,尤其在具有挑战性的遮挡与小目标条件下。

提出的方法

  • 采用具备扩展 ELAN(E-ELAN)结构的 YOLOv7,以增强特征学习与梯度流动,提升在遮挡场景下的检测准确率。
  • 应用图像拼接技术(2x1 和 3x3),将高分辨率无人机图像划分为更小的图像块,以提升对小型及隐藏牛只的检测能力。
  • 使用焦点损失训练 RetinaNet,分别采用 ResNet50 和 EfficientNet 主干网络,以缓解前景与背景物体之间的类别不平衡问题。
  • 采用 ResNet50 主干网络的 Mask R-CNN 进行实例分割,增加掩码头以预测像素级物体边界,提升定位精度。
  • 在 YOLOv7 中实现从粗到细的标签分配机制,以优化多输出检测头的训练过程并提升收敛性。
  • 使用多源数据集:来自巴西 Canchim 农场的 1161 张无人机拍摄图像(RGB 与热成像),以及来自哈佛大学的额外 249 张 RGB 图像数据集。

实验结果

研究问题

  • RQ1YOLOv7 在检测无人机拍摄的空中影像中被遮挡的牛只方面,相较于 RetinaNet 和 Mask R-CNN 表现如何?
  • RQ2图像拼接(2x1 与 3x3)对小目标及隐藏牛只检测性能有何影响?
  • RQ3在检测小型牲畜目标方面,与 ResNet50 相比,将 EfficientNet 作为 RetinaNet 主干网络的有效性如何?
  • RQ4YOLOv7 的 E-ELAN 结构与标签分配机制是否能提升高遮挡场景下的检测准确率?
  • RQ5在不同数据集与拼接配置下,哪一模型在牛只检测任务中实现了最高的精确率与召回率?

主要发现

  • YOLOv7 在使用 2x1 拼接的无人机数据集上实现了 61.2% 的最高精确率,优于所有其他模型。
  • 采用 ResNet50 主干网络的 RetinaNet 实现了 58.3% 的精确率,表现强劲但仍不及 YOLOv7 的准确率。
  • 采用 EfficientNet 主干网络的 RetinaNet 实现了 50.4% 的精确率,表明在此场景下对小目标检测效果较低。
  • Mask R-CNN 在无人机数据集上表现较差,但在外部 RGB 数据集上表现有所提升,成为该特定场景下性能最优的模型。
  • 2x1 拼接在所有模型中均优于 3x3 拼接,尤其显著提升了遮挡场景中对小目标的检测效果。
  • YOLOv7 与 2x1 拼接的组合在检测隐藏或部分可见牛只方面最为有效,凸显了模型架构与预处理策略的协同重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。