Skip to main content
QUICK REVIEW

[论文解读] Comparative Analysis of YOLOv9, YOLOv10 and RT-DETR for Real-Time Weed Detection

Ahmet Oğuz Saltık, Alicia Allmendinger|arXiv (Cornell University)|Dec 18, 2024
Smart Agriculture and AIAgricultural and Biological Sciences被引用 3
一句话总结

本研究评估了 YOLOv9、YOLOv10 和 RT-DETR 在农业领域实时杂草检测中的表现,对比了在 RTX3080、RTX3090 和 RTX4090 GPU 上不同模型尺寸和图像分辨率(320–960px)下的 mAP 和推理时间。YOLOv9 和 YOLOv10 在准确率与速度之间实现了最佳平衡,而 RT-DETR (l) 虽在较大分辨率下显著延长了推理时间,但实现了最高的 mAP。

ABSTRACT

This paper presents a comprehensive evaluation of state-of-the-art object detection models, including YOLOv9, YOLOv10, and RT-DETR, for the task of weed detection in smart-spraying applications focusing on three classes: Sugarbeet, Monocot, and Dicot. The performance of these models is compared based on mean Average Precision (mAP) scores and inference times on different GPU and CPU devices. We consider various model variations, such as nano, small, medium, large alongside different image resolutions (320px, 480px, 640px, 800px, 960px). The results highlight the trade-offs between inference time and detection accuracy, providing valuable insights for selecting the most suitable model for real-time weed detection. This study aims to guide the development of efficient and effective smart spraying systems, enhancing agricultural productivity through precise weed management.

研究动机与目标

  • 评估 YOLOv9、YOLOv10 和 RT-DETR 在智能喷洒应用中实时杂草检测的性能。
  • 分析不同模型架构和尺寸下检测准确率(mAP)与推理速度之间的权衡。
  • 评估输入图像分辨率(320px 至 960px)对模型准确率和推理时间的影响。
  • 基于硬件限制和性能指标,识别最适合实时农业应用的模型。
  • 通过提供在多样化硬件和分辨率设置下的实证基准,指导精准农业中目标检测模型的选择。

提出的方法

  • 本研究评估了 YOLOv9 和 YOLOv10 的 nano、small、medium 和 large 变体,以及 RT-DETR (l) 作为基于两阶段 Transformer 的检测器。
  • 在 320px、480px、640px、800px 和 960px 的图像分辨率下测试模型,以评估分辨率依赖的性能表现。
  • 使用 mAP50 和 mAP50-95 作为准确率指标,推理时间在三种 GPU 设备(RTX3080 笔记本、RTX3090 和 RTX4090)上记录。
  • 评估基于包含三种杂草类别(甜菜、单子叶植物和双子叶植物)的数据集,该数据集代表了真实世界中的智能喷洒场景。
  • 进行时间分布分析,以理解各模型架构中的计算瓶颈。
  • 通过对比可视化和统计分析,评估不同配置下检测质量和模型鲁棒性。

实验结果

研究问题

  • RQ1YOLOv9、YOLOv10 和 RT-DETR (l) 在不同图像分辨率下,mAP50 和 mAP50-95 的表现如何比较?
  • RQ2在不同 GPU 设备上,各模型的推理时间与检测准确率之间存在何种权衡?
  • RQ3提高图像分辨率如何影响各模型的 mAP 和推理时间?
  • RQ4哪种模型在农业环境中实现了实时杂草检测的最佳速度与准确率平衡?
  • RQ5在何种图像分辨率下会出现准确率显著下降?各模型变体如何响应此阈值?

主要发现

  • 更大的图像分辨率(如 960px)始终提升所有模型的 mAP 分数,其中 RT-DETR (l) 在 960px 时提升最为显著(mAP50: 68.1,mAP50-95: 87.2)。
  • YOLOv9 (c) 和 YOLOv10 (l) 在 RTX3080 上实现了超过 85–87 的 mAP 值,且推理时间低于 30ms,表明其具备出色的实时适用性。
  • RT-DETR (l) 在 960px 分辨率下实现了最高的 mAP50-95 得分(87.2),但推理时间最长(RTX3080 上为 34.7ms),表明其计算成本较高。
  • 640px 与 960px 之间的准确率差距较小,但在低于 640px 时准确率出现显著下降,尤其对 RT-DETR (l) 影响明显。
  • YOLOv9 和 YOLOv10 在不同图像尺寸和 GPU 上表现出稳定性能,mAP 和推理时间变化极小,显示出良好的鲁棒性。
  • 时间分布分析显示,RT-DETR (l) 在注意力机制和特征处理上花费更多时间,这是其推理速度慢于单阶段 YOLO 模型的主要原因。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。