Skip to main content
QUICK REVIEW

[论文解读] A SAM-based Solution for Hierarchical Panoptic Segmentation of Crops and Weeds Competition

Khoa Dang Nguyen, Thanh-Hai Phung|arXiv (Cornell University)|Sep 24, 2023
Smart Agriculture and AI被引用 6
一句话总结

本文提出一种混合方法,结合微调后的 YOLO-v8 和 DINO 目标检测器与 HQ-SAM,实现对作物和杂草的分层全景分割。通过使用检测器生成的边界框作为 HQ-SAM 的提示,该方法在 PhenoBench 数据集上实现了 81.33 的 PQ+ 分数,优于基线模型,并在具有细长结构植物的复杂农业场景中展现出强大的泛化能力。

ABSTRACT

Panoptic segmentation in agriculture is an advanced computer vision technique that provides a comprehensive understanding of field composition. It facilitates various tasks such as crop and weed segmentation, plant panoptic segmentation, and leaf instance segmentation, all aimed at addressing challenges in agriculture. Exploring the application of panoptic segmentation in agriculture, the 8th Workshop on Computer Vision in Plant Phenotyping and Agriculture (CVPPA) hosted the challenge of hierarchical panoptic segmentation of crops and weeds using the PhenoBench dataset. To tackle the tasks presented in this competition, we propose an approach that combines the effectiveness of the Segment AnyThing Model (SAM) for instance segmentation with prompt input from object detection models. Specifically, we integrated two notable approaches in object detection, namely DINO and YOLO-v8. Our best-performing model achieved a PQ+ score of 81.33 based on the evaluation metrics of the competition.

研究动机与目标

  • 为解决在农业场景中对具有复杂、细长结构形态的作物和杂草进行精确分层全景分割的挑战。
  • 通过结合目标检测与分割模型的模块化流程,提升田间植物表型分析中的实例分割与语义分割性能。
  • 评估基于提示的分割方法在具有高质量标注的真实世界农业数据集上使用微调 SAM 变体的有效性。
  • 通过针对性微调、LoRA 适配以及集成检测策略优化模型性能,提升在不同植物类型上的鲁棒性。

提出的方法

  • 该方法采用两阶段流程:首先,目标检测模型(YOLO-v8 和 DINO)生成边界框提示用于分割。
  • 采用高分辨率分割的 Segment Anything(HQ-SAM)模型作为分割主干网络,并在 PhenoBench 数据集上使用真实标注和增强后的边界框进行微调。
  • 在 HQ-SAM 微调过程中应用边界框增强,通过添加最多 20 像素或边界框尺寸 10% 的随机噪声,以提升对检测器输出不完美情况的鲁棒性。
  • 对 HQ-SAM 应用 LoRA 微调,以提升 GPU 显存效率,并支持在消费级硬件上进行训练。
  • 使用 IOU 阈值为 0.5 合并检测器输出以去除重复检测,并对宽度和高度超过 50 像素的杂草检测结果进行额外过滤。
  • 训练采用 AdamW 优化器,配合余弦退火学习率调度策略,若连续 20 个周期无性能提升则提前停止,并采用混合精度训练以提升内存效率。

实验结果

研究问题

  • RQ1使用检测器生成的边界框作为提示的基于提示的分割方法,能否在作物和杂草的分层全景分割中实现高性能?
  • RQ2对 HQ-SAM 进行边界框增强与 LoRA 微调,如何提升其在复杂农业场景中的分割精度?
  • RQ3YOLO-v8 和 DINO 在 PhenoBench 数据集中对不同植物类型(杂草、作物、叶片)的检测性能如何比较?
  • RQ4结合多个检测器(YOLO-v8 和 DINO)在多大程度上提升了检测与分割的鲁棒性?
  • RQ5在该流程中,模型架构选择(如 ViT-Base 与 ViT-Huge)如何影响推理质量与训练效率?

主要发现

  • 表现最佳的模型在 PhenoBench 数据集上实现了 81.33 的 PQ+ 分数,优于其他已报告的方法,包括 Mask R-CNN 和 Mask2Former。
  • YOLO-v8 nano 在杂草检测性能上与更大的 DINO 模型相当,表明其在杂草分割方面具有高效率与高有效性。
  • DINO 在检测叶片和作物方面表现更优,而 YOLO-v8 在杂草检测方面更胜一筹,这为在集成中同时使用两者提供了依据。
  • 使用检测器生成提示的微调 HQ-SAM 显著优于使用真实标注边界框的基线 HQ-SAM,证明了端到端适配的价值。
  • 在 HQ-SAM 微调过程中使用 LoRA 实现了高效的参数高效适配,同时显著降低了显存占用,支持在消费级 GPU 上训练。
  • 自动混合精度(AMP)提升了训练效率,但降低了叶片检测器的 AP 分数,表明在混合精度使用中存在任务特定的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。